具身数据的规模目前相对传统的文本和图像数据来说还是比较小的,面临着稀缺性的挑战。
根据Coatue的相关数据,具身机器人数据集仅有2.4M,这个规模远低于文本数据集的15T Tokens和图像数据集的6B Images 【1】 【7】 。
不过,也有一些具体的数据集案例,比如江苏箸境智能科技有限公司在江苏省数据交易所上架的“具身智能数据集”包含约2.5万条结构化数据 【2】 【3】 。还有像智元机器人携手上海人工智能实验室等机构发布的全球首个百万真机数据集AgiBotWorld,包含100 多万条演示轨迹 【7】 。谷歌 DeepMind 联合 21 家机构发布的 Open X-Embodiment 数据集,也包含超过 100 万条机器人演示轨迹 【7】 。
有观点认为具身数据与文本数据的可用量级差距约20,000倍 【10】 。2024年具身智能大模型数据量仅为百万级 【14】 。
总体而言,具身数据的规模还在发展阶段,真实数据尤其稀缺,行业对大规模、高质量数据的需求非常迫切。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803