核心观点
- 物理人工智能(Physical AI)的发展缓慢,主要因为其训练数据扩展更具挑战性。所需的数据必须包含交错观察和动作的序列,而这些动作会干扰物理世界,可能造成损害。
- 世界基金会模型(WFM)被视为解决数据扩展问题的长久解决方案。WFM是物理世界的数字孪生,允许物理AI安全地与之互动。
- 本文介绍了用于构建物理人工智能的宇宙世界基金会模型(WFM)平台。该平台主要关注视觉世界基础模型,其中观测结果以视频形式呈现,扰动可以存在于各种形式。
- 提出了先预训练后微调的范式。预训练的WFM通过大规模视频训练数据集使模型接触到多样化的视觉体验,成为通才。微训练的WFM使用针对特定物理AI环境的特定数据集进行微调,以到达一个专业化的工作频率模型。
- 开发了视频数据编纂流程。该流程定位视频中的丰富动态和高视觉质量的片段,有助于学习视觉内容中编码的物理学。
- 构建了基于扩散和基于自回归的WFM。这两种方法都将困难的视频生成问题分解为更简单的子问题,使其更容易处理。
- 提出了摄像机控制、机器人操作和自动驾驶场景的示例。展示了预训练的WFM如何在这些应用中发挥作用。
- 开发了护栏系统。该系统阻止有害输入和输出,确保物理AI系统的安全性。
关键数据和研究结论
- 收集了约2000万小时的原始视频,分辨率从720p到4k不等。
- 开发了一族不同压缩比的视频标记器,这些标记器是因果的。
- 构建了一系列不同容量的模型,并研究它们在各种下游应用中的有效性。
- 评估结果显示,Cosmos WFMs在生成高质量、3D一致的逼真视频方面表现出色。
- 评估结果还表明,Cosmos WFMs在物理对齐方面也取得了显著进展。
- 护栏系统能够有效地阻止有害输入和输出,确保物理AI系统的安全性。
总结
Cosmos WFM平台为物理AI构建者提供了一个强大的工具,帮助他们构建更安全、更高效的物理AI系统。该平台的开源性和开放权重将进一步推动物理AI领域的发展。