1. 世界模型与具身数据
世界模型赋予AI理解世界、预测未来并进行自主决策的能力,是通用人工智能发展的关键。具身智能需要比大语言模型和自动驾驶模型更多的数据,且数据需求具有EB级规模、强调物理交互的多样数据模态、对质量与异构性的极高要求。当前具身数据面临采集成本高、模态不足/维度匮乏、格式不统一导致的通用性差、异型数据融合困难以及数据孤岛等挑战。
2. 数据采集方案
具身数据采集主要有三大方案:
- 真实数据:保真度高但采集成本高昂,可通过部署型采集、远程操控示教、穿戴式传感系统等方式采集。
- 合成/仿真数据:可大规模获取,成本投入低,但存在Sim2Real Gap,需要通过Sim2Real技术路径解决。
- 视频数据:来源广泛,训练成本低,但存在物理交互缺失、噪声干扰大、具身本体差异、缺乏精准标注、长时序一致性挑战等问题。
3. 数据采集难点与趋势
具身数据采集面临真实数据匮乏、仿真迁移鸿沟与长尾泛化挑战。未来,仿真/视频数据主要用于预训练,而真实数据则更多用于VLA微调和强化学习。
4. 具身智能本体厂商数据解决方案
- 真实数据派:智元机器人、自变量机器人、特斯拉Optimus(早期)、1X Technologies等,通过本体部署、动作捕捉、遥操作等方式在真实场景采集数据。
- 合成/仿真数据派:银河通用等,主要利用合成数据进行预训练并结合少量真实数据进行优化。
- 布局视频数据新方向:逐际动力、千寻智能、星动纪元、特斯拉Optimus、Skild AI、Figure AI等,通过互联网视频进行大规模训练,减少对真实数据源的依赖。
- 主流策略:大部分厂商普遍采用仿真/视频与真实数据结合、预训练与后训练协同的策略。
5. 具身数据产业全景
- 一级市场产业龙头:枢途科技、跨维智能、光轮智能、智元机器人、杭州编解码、艾欧智能等。
- 二级市场相关公司:海天瑞声、索辰科技等。
6. 风险提示
技术路线收敛风险、市场竞争加剧风险、行业技术投入不达预期风险、政策落地不及预期风险。