一句话:具身智能当前"GPT-2之前"状态;VLA与世界模型同构终将融合,胜负手在数据scaling演进;2—3年盯首个千万小时级异构数据模型泛化验证,达标即陡峭上行。 一、路线与阶段:VLAvsWM同构,当前"GPT-2之前" 路线:底层均transformer+diffusion动作输出,差异仅训练模式/预测目标,可互相改造、终将融合。VLA落地领先但依赖带action标注数据,头部遥操作/UMI仅十万—数十万小时,scaling瓶颈显著;世界模型可兼容无标注海量视频,已有百万小时级数据集,与大模型"预测下一token"逻辑一致,是必然方向。涌现判断:一、举一反三;二、组合创新。 阶段:最新模型新任务成功率仅约60%,且任务多经精心挑选,无稳定强泛化。具身需理解物理世界分布、接触逻辑、长程任务分配,GPT-2→GPT-3鸿沟比语言模型更大。下一代目标:面向具身的上下文学习,新任务仅需1—2条示例即可生成控制。两大缺口:一、大规模数据闭环;二、统一评测基准(当前多仿真,与真实gap大)。 二、格局与数据:10分以内,数据scaling是胜负手 格局:满分100,所有参与者均在10分以内,未达可用标准;分水岭在规模化应用后数据指数增长,现阶段追逐路线/身位无意义。海外已有厂商公布50万—200万小时数据,Figure02发布,整体百万小时效果验证、涌现初现。 数据:规模需求百万→千万→亿→10亿小时,每提升一个数量级可能带来能力跃升,未见天花板。四大瓶颈:有效数据转化率低;多源异构视频流存储处理成本远高于文本;无统一格式标准,contact真值标注难于自动驾驶;数据通用性弱,3—5年后价值不确定。最难是contact标注,带动带触觉/关节数据手套需求。市场处"卖铲子"阶段,数采/存储/算力是确定性需求。 三、国内投入与落地拐点 投入:按本体为主/模型为主/二者兼具三类。头部本体(宇树、智元)年出货均1万台以下。头部单月资本开支大几千万元(不含人力):数采1000万—2000万、存储数百万、算力约2000万;成本占比最高是数据。 拐点:未来2—3年核心看首个千万小时级异构数据模型泛化效果,验证显著优于百万小时级即全行业资源疯狂涌入。千万小时级数据以异构为主,含大量人类第一视角,仅约1%本体真机;预训练用千万小时异构,后训练仅需千—万小时本体数据即可激发能力。 落地:当前唯一相对成熟场景为物流分拣包裹翻转(低难度细分),更精细任务尚无法实现。模型"小学阶段"做基础预训练、不绑定场景;直接绑定场景多为demo。进入"大学阶段"后才向专业场景定向专用化。 四、盯什么(比路线之争重要) 首个千万小时级异构数据模型泛化验证→达标即行业陡峭上行;数据格式/评测标准统一进展;contact标注工具与数据手套迭代;本体出货与数采体系建设。路线选择/身位先后非核心变量。