2024年人形机器人最具突破性的进展主要体现在具身智能领域,Covariant发布端到端具身大模型RFM-1,Sergey Levine和Chelsea Finn创立Pi,Figure AI接入OpenAI GPT-4V的Figure 01 demo,李飞飞创立World Labs,特斯拉展示Optimus精准分拣电池的场景。国内人形机器人产业硬件供应链优势明显,但在具身智能、数据采集、人才领域存在短板。
具身智能大模型主要分为非具身大模型(基础大模型)和具身智能大模型(机器人大模型),区别在于能否生成运动姿态。非具身大模型如GPT、Sora等,输入输出模态为语言、图片和视频;具身智能大模型输入视觉、语言信号,输出三维物理世界的操作。具身智能大模型主要有端到端和分层端到端两种路径,目前主流方案为分层端到端,典型代表为Figure AI,其采用三层大模型系统:基础大模型(LLM或VLM)、决策大模型、操作大模型。
分层端到端大模型中,基础大模型负责多模态感知,决策大模型负责任务理解、自动生成运控指令,操作大模型负责执行具体动作。决策大模型技术方向从LLM向强化学习(RL)演进,操作大模型技术方向从“MPC+WBC”向“RL+仿真”演进。
数据采集是具身智能的关键,主要方式为远程操作和仿真合成数据。互联网上各类文本、图像和视频数据集庞大,但机器人场景和交互有价值的数据量小,限制了AI模型泛化能力。特斯拉使用人类真实运动方式训练机器人,英伟达通过真人的遥操作数据捕获和生成合成运动数据,加速机器人技术研发和应用。国内人形机器人创新中心加速建设人形机器人训练场。
具身智能估值逻辑主要基于硬件、数据、模型和人才。硬件是基础,需要自研高性能稳定硬件;数据采集、组织管理和模型开发需要强大组织能力和专业算法团队;人才是关键,需要具备组织大规模工程师经验和深入研究和开发算法的能力。
具身智能面临落地难题、技术难度被低估、竞争激烈、投资过度引发泡沫等风险。