事件描述
2025年2月20日,人形机器人公司Figure发布自主研发的通用视觉—语言—动作(VLA)大模型Helix,该模型对Figure公司和人形机器人行业具有重要意义。
模型创新点
- 全新的双系统模型:Helix通过系统1和系统2的密切配合,实现200Hz的高频轨迹输出,解决VLA模型运行速度慢的问题。系统2为经互联网预训练的VLM,以7-9Hz的频率运行,用于场景和语言理解;系统1为快速视觉运动策略,将系统2内容转化为200Hz的机器人动作。
- 高效训练:Helix训练使用500小时的高质量监督数据,不足以往VLA数据集大小的5%。
- 低算力需求:Helix在低功耗GPU上运行。
- 多机器人协作:Helix首次展示2个人形机器人协作处理任务的场景。
Helix与理想汽车双系统的异同
- 交互模式:Helix的系统1和系统2通过潜在向量进行交互,经过端到端训练实现联合优化;理想汽车的系统1和系统2通过prompt的问题库进行交互,系统2输出包含环境理解、决策建议和参考轨迹。
- 性能表现:Helix的性能表现优于理想汽车的双系统,仍有提升空间。
Helix对产业投资逻辑的影响
- 加速产业发展:Helix模型支撑Figure估值快速上涨至395亿美元,资本涌入将加速产业发展。
- 数据壁垒高度:Helix使用少量互联网数据实现良好泛化效果,需重新审视数据壁垒高度。
- 自动驾驶潜力:Helix的低功耗GPU展示出优秀泛化能力,未来VLA模型部署将提升车辆应对corner case的能力,L3级自动驾驶近在咫尺,L4级也不遥远。
风险提示
- 人形机器人技术路径尚未定型,面临技术路线风险。
- 人形机器人应用场景尚不明确,需求存在不及预期风险。