计算机行业深度报告:大脑:具身智能落地的关键
机器人大脑的定义和能力
人形机器人由“大脑”、“小脑”和“肢体”三部分组成。“大脑”基于AI大模型,实现自主导航、任务执行和人机交互等功能。人形机器人“大脑”大模型需具备实时交互、多模态感知、自主可靠决策、涌现和泛化能力。机器人大模型与通用大模型存在区别,难以直接共用。
人形机器人大模型多技术路线并行探索
人形机器人大模型技术路线主要包括:
- 端到端VLA技术路线:单一模型从感知到动作的端到端学习,适用于短程任务,但复杂长程任务存在局限性。
- 大脑+小脑分层技术路线:多模态大模型负责高层决策和任务规划,“小脑”处理运动控制和执行任务,实现分层协作。
- 世界模型技术路线:构建对物理世界的完整建模,通过预测未来状态优化动作决策,代表最前沿的探索方向。
此外,类脑智能和脑机接口等创新技术也为“大脑”解决方案带来可能。
人形机器人大脑行业参与者
行业参与者分为三类:
- 专门做机器人大脑的公司:如中国的通研院、美国的Physical Intelligence和Skild AI等。
- 通用大模型公司:如谷歌、OpenAI、字节、阿里等。
- 具身智能企业自研:如智元机器人、特斯拉等。
三种参与者各有优劣势,最终在机器人大脑市场都会有一席之地。
具身智能大脑是具身智能发展的关键瓶颈
王兴兴强调,机器人大模型是具身智能发展的关键瓶颈,限制人形机器人大规模应用。目前机器人大模型的发展进度类似于ChatGPT发布前1-3年,业界已发现类似方向和技术路线,但尚未真正实现。
具身智能大模型研发的难点
- 训练数据难以获得:真实数据稀缺且获取门槛高,仿真数据虽可大规模生成,但训练出的模型往往不适应真实世界。
- 学习训练难度大:具身智能的学习训练方法还有待探索,目前企业多采用世界模型、遥控操作、仿真迁移、模拟训练等方法,但都有局限性。
全球各大机器人大脑厂商百花齐放
Tesla Optimus
Optimus机器人大模型核心突破在于抛弃传统机器人的“模块化分工”模式,采用单一基础模型架构,实现从感知到行动的端到端自主决策。xAI Grok深度融合赋予机器人逻辑推理与记忆能力。
Figure AI
Helix模型是全球首个能够对整个人形机器人上半身进行高频率、连续控制的视觉-语言-动作(VLA)模型,实现“感知-理解-决策-执行”的端到端闭环。其核心优势在于多模态融合能力、多机器人协同能力、快速技能迁移能力,以及数据驱动的进化逻辑。
Physical Intelligence
Physical Intelligence开发可推广到各种环境的机器人基础模型,最新的π0.5建立在其视觉-语言-行动(VLA)模型π0基础上,可指挥机器人清理训练数据中没有看到的新家的厨房或卧室。公司估值24亿美元。
Skild AI
Skild AI模型的训练逻辑类似于AI大语言模型,通过输入大量高质量机器人动作数据,让模型最终具备一定程度的通用智能。公司估值已达45亿美元。
通研院
通研院推出“通智大脑”全栈式具身智能底座,基于全球首个通用智能人“通通”的核心技术,构建贯通感知—理解—决策—执行的具身智能体框架。与宇树合作提供大脑,品茗科技子公司拟协议转让取得品茗科技16%股权。
银河通用
银河通用选择以合成数据驱动的具身大模型研发,提出“三层级大模型系统”,包括硬件层、技能层和顶层大模型。公司估值115亿元。
智元机器人
智元机器人发布首个通用具身基座模型——智元启元大模型(GenieOperator-1),提出Vision-Language-Latent-Action (ViLLA)架构,实现利用人类视频学习,完成小样本快速泛化。
星动纪元
星动纪元推出首个同时能实现“大运动+巧操作”的全尺寸双足人形机器人——星动L7,核心驱动力来自于星动纪元自研的端到端VLA具身大模型ERA-42。
星海图
星海图围绕具身智能的快-慢双系统模型架构EFM-1,融合“慢思考”的视觉语言大模型(VLM)与“快执行”的动作大模型(VLA),实现从感知理解到精确控制的闭环决策。
自变量机器人
自变量机器人聚焦自研“通用具身智能大模型”,构建具备精细操作能力的通用机器人,是国内最早采用完全端到端路径实现通用具身智能大模型的公司之一。
投资建议
具身智能市场发展迅速,大脑是具身智能发展的关键。当前具身智能大脑技术路径尚在探索阶段,但全球各种机器人大脑公司百花齐放,加大投入尝试各种技术方案。建议关注具身智能大脑相关标的。
相关标的
品茗科技、银河通用、智元机器人、星动纪元、星海图、自变量机器人、Tesla、Figure AI、Physical Intelligence和Skild AI等。
风险提示
技术研发不及预期、具身智能产业发展不及预期、技术路线发展不确定性。