模型范式从直接预测动作(RIP VLA)转向预测未来世界+动作(WAM),数据需求也随之变化。
01 模型范式变化:从“观察→动作”的反应式策略(VLA)转向用未来世界状态作为额外监督和中间表征(WAM)。
- VLA:视频帧作为密集监督,动作标签作为主要训练信号。
- WAM:未来状态预测与动作预测共同作为训练信号,更充分利用物理交互序列。
02 数据需求变化:视频中的物理交互序列成为更密集的训练信号。
- WAMera数据不仅需要动作标注,更要覆盖真实世界状态变化。
03 数据入口变化:需要低成本、多场景、少本体鸿沟的数据采集方式。
- 瓶颈:如何低成本地持续采集真实、多样、可对齐的人类操作数据。
- 答案:UMI数据(多样性+无本体化)。
为什么是UMI:
- ① Diversity上限更高:手持/穿戴式采集,任务、物体、环境覆盖面远高于单一机器人遥操作。
- ② Cross-embodiment gap更低:共享视角/轨迹/夹爪接口,减少人类示教、不同机械臂、末端执行器之间的本体差异。
UMI的核心价值:
- 更容易做长尾任务采样。
- 更适合构建真实世界数据飞轮。
- 训练数据更容易跨硬件复用。
- 为WAM/VLA提供更稳定的动作监督。
结论:
- WAM需要“会动的世界数据”;UMI把真实人类操作变成可规模化、可对齐、可泛化的数据资产。
存储瓶颈与解决方案:
- VLA大模型训练规模化后,存储成为关键瓶颈(多机共享不足、数据分散、存储带宽瓶颈)。
- 腾讯云COS+GooseFS高性能共享存储实现模型生产效率跃升:
- 统一管理多机协同。
- 安全可靠(全量写入COS降低数据丢失风险)。
- 高效训练(GooseFS多机共享能力及40 Gbps吞吐性能)。
- 数据闭环(支撑数据采集、预处理、训练与推理全流程)。
Livsyn产品体系:
- 从采集设备到数据平台,面向VLA/WAM的端侧无本体采集设备+LDP数据平台+训练评测闭环。
- 从UMI采集到WAM训练:端云一体化数据闭环。
- 核心价值:同一套无本体数据资产,既服务VLA,也为WAM提供世界状态预测所需的视频序列。
LivUMIGrip:
- 轻量化手持夹爪与多模态传感器融合,记录真实世界中的操作行为。
- 关键能力:无本体UMI、空间定位(8mm/1mm)、触觉+视觉同步(0.1N触觉分辨率)。
LivUMI Ego:
LDP到模型训练:
- 平台不是单点工具,而是把采集、管理、训练、部署贯穿起来的基础设施。