研报核心主题:数据规模化为核心变量,千万小时级训练成关键拐点研报核心主题:数据规模化为核心变量,千万小时级训练成关键拐点 摘要摘要 1.行业阶段与核心瓶颈行业阶段与核心瓶颈:具身智能正处于GPT-2之前的早期阶段,核心瓶颈在于高质量动作数据的稀缺核心瓶颈在于高质量动作数据的稀缺。2.数据采集能力差异数据采集能力差异:数据采集规模化能力排序为Ego视角方案>UMI类设备>遥操作,但数据质量排序恰好相反。3.技术融合趋势技术融合趋势:世界模型与VLA趋于融合,世界模型可通过预测视频下一帧兼容大规模弱动作信息数世界模型可通过预测视频下一帧兼容大规模弱动作信息数据据。4.行业拐点判断行业拐点判断:行业拐点取决于千万小时级数据训练效果行业拐点取决于千万小时级数据训练效果,若Scaling Law持续生效将引发行业资源涌入。5.训练成本结构训练成本结构:训练成本高昂,头部公司每月资本开支约数千万元,数据成本占比最高,区间为数据成本占比最高,区间为1-2千千万万/月月。6.数据配比情况数据配比情况:预训练与后训练数据配比约为1,000:1,即千万小时Ego数据配对万小时本体数据。7.落地场景判断落地场景判断:落地场景优先看好任务难度较低的物流分拣,当前行业仍处于通用基础能力构建阶段当前行业仍处于通用基础能力构建阶段。 Q&A 在当前阶段,VLA模型在落地应用和执行成功率方面领先于世界模型。然而,世界模型被视为一个重要的未来方向,其核心原因在于具身智能模型普遍面临数据稀缺的问题。解决数据稀缺问题需要从两个层面分析: 1.训练数据类型需求:以VLA为代表的模型,其名称中的“A”代表Action(动作),因此强依赖于包含高质量动作信息的数据进行训练,动作数据的质量直接影响数据采集的规模化能力。2.采集成本与质量:最高质量但成本也最高的数据是遥操作数据,这类数据质量高,但通常需要绑定特定的机器人本体,导致规模化采集的投入成本巨大。 知识星球:芒果纪要 其次是无本体的数据采集方式,如UMI这类夹爪式设备,其规模化程度相对较好,但操作员长时间穿戴会产生不适,难以持续工作。之后,英伟达推出的Eagle Scale方案,通过第一人称视角佩戴设备来捕捉双手动作,其规模化采集能力被认为是比较理想的。从数据采集方式来看,规模化能力由弱到强依次是遥操作、UMI类设备、Ego视角方案。然而,从数据质量和直接落地应用的角度看,遥操作和UMI类数据更优。 VLA模型的发展受益于这两类高质量数据,但其扩展规模非常有限,头部机构的数据积累量级大约在十万到几十万小时,无法满足持续增长的需求。世界模型正是在Ego视角这类具备大规模扩展潜力的数据维度上发展起来的。例如,近期的Dyna 2模型就推出了百万小时级别的数据集。 世界模型与世界模型与VLA最核心的区别在于,它能兼容更多类型的数据,尤其是那些不包含或只包含弱动作信息的最核心的区别在于,它能兼容更多类型的数据,尤其是那些不包含或只包含弱动作信息的数据数据。在现实中,最容易获取的正是这类对质量要求不高的数据。当只有视频而没有精确的动作数据时,VLA无法进行有效训练,但世界模型除了动作预测外,还可以通过其“World Model”部分来预测视频的下一帧。从模型结构上看,两者并无本质区别,底层可能都采用Transformer架构,动作生成则可能使用Diffusion Action Expert (专家头)。它们的差异主要体现在训练模式和预测目标上。因此,未来两者并非互斥,而是会走向融合。VLA模型可以快速改造为世界模型,反之,世界模型去掉其下一帧预测头也可以成为一个VLA模型。 问题问题1:具身智能模型训练中的:具身智能模型训练中的“涌现涌现”现象发生场景?现象发生场景? 对于具身智能模型训练中出现的对于具身智能模型训练中出现的“涌现涌现”现象,它具体是指在预测下一帧视频时发生,还是在预测动作时发现象,它具体是指在预测下一帧视频时发生,还是在预测动作时发生生? “涌现”是一个相对抽象的概念,并非具体指模型能精准预测某一内容。我们可以借鉴GPT的案例来理解:当模型能够根据少量上下文中的示例(可能从未见过该示例),并“依葫芦画瓢”地完成任务时,就可以认为出现了智能涌现。这体现了模型举一反三的能力。更进一步的涌现是指,当面对一个从未见过的全新任务时,模型能依托于过往任务的经验,组合出新的解决方案。因此,涌现现象并不局限于特定的预测方向涌现现象并不局限于特定的预测方向(如预测下一帧或预测动作如预测下一帧或预测动作),其,其核心在于通用能力的体现核心在于通用能力的体现。当一个模型能很好地回答各种问题,尤其是那些不在其训练数据集中或与训练数据不完全相同的问题时,就展现了通用性。我们将模型在走向通用性的过程中表现出的这种苗头定义为“涌现”。并且,这种苗头会随着数据规模的增加而愈发明显。从提示工程到Agent,再到Harness,本质上都是在涌现的基础上,进一步挖掘和利用模型的通用能力。 问题问题2::Physical Intelligence模型的迭代驱动与关键变量?模型的迭代驱动与关键变量? 以以Physical Intelligence的模型为例,从的模型为例,从PI-0到到PI-0.5版本的迭代,其核心驱动方向是什么版本的迭代,其核心驱动方向是什么?下一代模型迭代的下一代模型迭代的关键变量是在数据规模、动作表征还是模型架构层面关键变量是在数据规模、动作表征还是模型架构层面? 从PI-0到PI-0.5的迭代路径主要体现在两个方面: 1.数据层面数据层面:数据采集量持续增加,并且能够针对不同的任务和机器人构型进行泛化与实现,最终目标是实现跨任务、跨场景和跨机器人的通用能力。2.模型层面模型层面:同步进行迭代优化,例如动作表征的优化。 展望未来的迭代,关键变量更多地会集中在数据层面。 包括数据规模的扩大和数据训练方式的优化。虽然模型架构和动作表征也会更新,但其带来的性能提升曲线,预计不如数据规模化(data scaling)带来的影响显著。 具身智能的下一步发展方向是什么?例如具身智能的下一步发展方向是什么?例如Gen-1.5提出的提出的in-contextlearning将如何具体实现?将如何具体实现? 具身智能的下一步发展方向是面向任务的涌现能力具身智能的下一步发展方向是面向任务的涌现能力。具体而言,针对一个新任务,未来可能不再需要采集大量数据(例如原先需要的100小时),而是仅需提供一到两个示例即可。Gen-1.5正在探索的in-context learning正是这一方向的体现。在机器人应用中,提示词可以是一个示例,例如一段仿真视频或人类操作的视频。机器人基于这个示例,就能够生成相应的运动控制过程。这可以被视为面向具身智能的提示词工程(提示词工程(prompt engineering)),其核心在于通过示例案例进行引导,是未来具身智能的一个重要发展方向其核心在于通过示例案例进行引导,是未来具身智能的一个重要发展方向。 当前具身智能模型展现出的泛化潜力,若与大型语言模型当前具身智能模型展现出的泛化潜力,若与大型语言模型GPT的演进史的演进史对标,大概处于哪个阶段?对标,大概处于哪个阶段? 当前具身智能模型的发展阶段,可以类比为类比为GPT-2之前之前。这个阶段的主要成果是证明了规模化学习的有效性,即增加数据和模型规模能够带来性能提升,避免了模型崩溃,并推动其向更成功的方向发展。然而,目前尚未出现一个稳定且具备强大任务泛化能力的模型。以Gen-1.5为例,其针对新任务的成功率仅为60%,且展示的成功案例可能经过了精心挑选(cherry-pick)。要实现从GPT-2到GPT-3的跨越,具身智能面临的鸿沟比语言模型更大具身智能面临的鸿沟比语言模型更大。这不仅涉及语言理解,更关键的是需要真正理解物理世界的分布、物理接触、长程任务规划以及从失败中恢复的能力,这些都比纯粹的语言层面要困难得多。因此,尽管目前看到了一些希望,但对现状不应过分乐观对现状不应过分乐观。 从当前类似从当前类似“GPT-2之前之前”的阶段发展到实现类似的阶段发展到实现类似“GPT-3.5”的涌现式爆的涌现式爆发,具身智能领域目前主要欠缺哪些关键要素?发,具身智能领域目前主要欠缺哪些关键要素? 要实现从当前阶段到涌现式爆发的跨越,主要欠缺两大关键要素两大关键要素。 1.数据闭环:实现数据和模型的同时规模化扩展数据闭环:实现数据和模型的同时规模化扩展,这与GPT-2到GPT-3的发展路径相似。2.建立更有效的任务评测基准建立更有效的任务评测基准。当前大语言模型有众多成熟的benchmark进行评测,但具身智能领域公认的评测体系仍处于早期,多依赖仿真环境。然而,仿真与真实世界存在巨大差距,导致现有评测体系难以准确反映模型的真实能力。目前行业内评测标准不一,导致许多机构都可以宣称自己是“世界第一”,这恰恰说明了评测体系本身失去了其应有的意义。一个能够准确映射模型所处阶段的评测体系至关重要一个能够准确映射模型所处阶段的评测体系至关重要。 知识星球:芒果纪要 如何评价当前海外市场中,如如何评价当前海外市场中,如Dyna 2、、PI、谷歌、特斯拉以及、谷歌、特斯拉以及Figure的的Helix等不同参与者在具身智能领域的竞争地位?等不同参与者在具身智能领域的竞争地位? 现阶段具身智能领域仍处于非常早期的发展阶段,如果以100分为满分,所有参与者可能都处于10分以内的水平。虽然目前看来各家之间存在差异,例如领先者可能获得11分,而其他参与者为5至6分,看似差距显著,但从“可用”或“及格”的标准来看,所有参与者都远未达到。由于行业极度缺乏数据,导致整体表现不佳。因此,在当前阶段过分关注或追逐谁的路线更优、谁的地位更好,并没有太大意义。当技术真正落地应用,产生可量化的指标(例如类似大模型每日token处理量的指数级增长)时,对地位的评测才具有实际价值。 要推动具身智能模型实现从类似要推动具身智能模型实现从类似GPT-2到到GPT-3的跨越,所需的数据量的跨越,所需的数据量 级大概是多少级大概是多少?在数据处理方面又面临哪些挑战在数据处理方面又面临哪些挑战? 从数据量层面看,目前最先进的水平是百万小时级别,未来的目标将是千万、上亿乃至十亿小时级别。由于尚未观察到规模效应定律(scaling law)的天花板,因此对于数据量的态度是开放的,即多多益善。然而,除了数据量,数据基础设施(数据基础设施(data infra)是另一个关键层面)是另一个关键层面。拥有一百万小时的原始数据,不代表这些数据能直接用于训练。数据需要经过清洗、对齐、管理和格式转换等一系列处理,有效数据的比例是关键。具身智能的数据以视频流为主,可能还混杂其他类型数据,这给数据处理带来了巨大挑战。视频数据的质量清洗、画面对齐视频数据的质量清洗、画面对齐(例如单目例如单目与双目、头部与手腕视角与双目、头部与手腕视角)等都对数据管线要求极高等都对数据管线要求极高。此外,随着图片和视频流数据的规模化,其管理成本也急剧增加,因为单张图片所包含的信息量远超文本,这对整个数据和模型体系构成了严峻挑战。 如何评价国内创业公司如何评价国内创业公司(如智元、乐聚、优必选如智元、乐聚、优必选)与大厂与大厂(如字节、小鹏、如字节、小鹏、小米小米)在具身智能模型上的进展在具身智能模型上的进展?同时,训练一个具身智能模型的成本构成同时,训练一个具身智能模型的成本构成是怎样的是怎样的? 行业内通常不以初创公司或大厂来划分,而是根据其业务重心分为三类:以本体为主、以模型为主,或两者兼顾。从本体(硬件)角度看,市场仍有巨大的发展空间。即便是头部的宇树或智元,其人形机器人的年出货量也低于一万台,这与汽车行业热门车型单月销量过万相比,规模非常小。市场空间的释放最终依赖于模型能力的突破,这也是模型层面备受关注的原因。然而,从从业者角度看,整个行业仍处于非常初期的摸索阶段,例如,数据的格式尚未