具身智能是一种基于物理身体进行感知和行动的智能系统,强调智能体通过物理身体与环境的直接交互来产生认知和行动。具身智能是人工智能与机器人学交叉的前沿领域,其核心在于将感知、行动与认知深度融合。
具身智能的发展经历了萌芽、积累和突破三个阶段。萌芽阶段从1927年第一个电驱人形机器人诞生到1986年罗德尼·布鲁克斯提出感知和动作驱动的环境交互设计;积累阶段从1990年麻省理工学院推出模仿人头部的机器人Kismet到2020年美国敏捷机器人公司DIGIT和中国达闼机器人发布CloudGingerXR-1;突破阶段从2021年中国优必选WalkerX实现双足机器人行走能力突破到2025年挪威公司1XTechnologies发布仿人体骨骼结构NeoGamma机器人。
具身智能的五个阶段包括无智能阶段、基础智能阶段、中等智能阶段、高度智能阶段和超级智能阶段。目前,具身智能正处于从中等智能阶段向高度智能阶段过渡的关键时期。
具身智能的三大核心要素是本体、智能和环境。本体是智能体的物理载体,具备感知、运动和操作能力;智能负责感知、理解、决策和控制,通常由多模态大模型驱动;环境是智能体交互的物理世界,包括动态变化的场景和任务目标。
具身智能的分类包括按功能用途分为工业机器人、服务机器人和特种机器人;按形态分为人形机器人、固定式机器人、轮式机器人/履带式机器人、多足机器人和仿生机器人;其中,人形机器人因其通用性和交互优势最为引人瞩目。
具身智能的组成部分包括本体、大脑和小脑。本体包括机械结构、传感器、执行器、驱动与能源系统、通信系统等;大脑负责感知、理解和规划,主要通过大语言模型、视觉语言动作(VLA)大模型来驱动;小脑负责将决策转化为具体动作,也就是运动控制和动作生成。
具身智能的工作原理分为感知-决策-行动-反馈四个模块。感知模块通过传感器收集环境信息;决策模块基于感知数据,利用大模型进行任务规划和推理;行动模块执行决策结果;反馈模块通过环境反馈优化感知、决策和行动,形成闭环。
具身智能的训练方法包括模仿学习和强化学习。模仿学习通过观察和模仿专家行为来学习任务;强化学习智能体通过与环境的交互来学习最佳行为策略。
具身智能的数据集分为真实世界数据采集和仿真世界数据采集。真实世界数据采集通过传感器或人工操作在物理环境中直接记录动作轨迹与环境反馈;仿真世界数据采集利用计算机模拟技术在虚拟环境中生成智能体与环境交互的数据。
具身智能的核心技术是多模态大模型,包括大语言模型(LLM)、视觉语言模型(VLM)和视觉语言动作模型(VLA)。
具身智能的产业链包括硬件产业链、软件产业链和整机厂商。硬件产业链涉及芯片、传感器、控制器、电机、通信模组和能源管理等;软件产业链包括AI算法、操作系统、云服务和中间件等;整机厂商包括科技大厂、高校以及科研机构等。
具身智能的未来发展包括具身通用智能(EmbodiedAGl)和多模态融合、跨领域迁移等方向。同时,具身智能也面临技术、数据、成本、伦理与道德、安全与隐私、资金和人才等挑战。
具身智能的市场规模预计将持续增长。根据业界有关机构的数据,2023年,全球人工智能(Al)机器人市场规模达到143.0亿美元,预计到2032年,将达到824.7亿美元左右,复合年增长率为21.50%。根据2024年2月高盛发布的最新预测,全球人形机器人市场规模预计将在2035年将达到378亿美元,出货量达140万台。