物理物理AI数据产业趋势分析与投资决策参考数据产业趋势分析与投资决策参考 摘要摘要 物理物理AI数据已成明确产业趋势数据已成明确产业趋势:数据层作为技术齿轮层底座,是感知、决策等五大环节的核心支撑。供需缺口巨大供需缺口巨大:全球机器人训练数据仅240万级,对比文本大模型15万亿token存在跨数量级鸿沟;具身智能可用数据缺口达20倍以上。资本热度极高资本热度极高:2026年上半年国内具身智能融资达935亿元,同比增5倍;光轮智能等数据基础设施公司估值已达150亿元。技术路径演进技术路径演进:短期靠“ego+umi”便携式众包采集破局,中长期看好“世界模型+仿真合成”以解决真机依赖与劳动力不足。商业闭环优势商业闭环优势:物理AI数据产权清晰且敏感性低,易实现资产化,被视为数据要素发展的第二阶段,2030年市场空间或超5,000亿元。 二级市场标的二级市场标的: 1.海天瑞声(第二增长曲线) 2.中科创达(仿真与数采工厂)3.汇川技术(全链条布局)4.能科科技(工业数据治理) Q&A 物理物理AI数据领域为何具备显著的产业趋势,其背后的主要驱动因素是什么?数据领域为何具备显著的产业趋势,其背后的主要驱动因素是什么? 物理AI数据领域展现出显著的产业趋势,主要基于两大核心驱动因素。首先,产业层面已形成共识,即当前物理AI数据存在刚性且达到数量级的缺口。从二级市场部分公司的反馈来看,其在物理AI数据或具身智能数据领域的布局、订单及客户交流情况均表现出超预期的乐观态势。其次,资本市场对此领域的倾斜正在加速。一级市场投融资景气度较高,除光轮智能等知名项目外,许多其他初创公司也因其在物理AI数据领域的布局获得了新一轮融资。综合产业逻辑与资本动向,物理AI数据的发展已构成明确的产业趋势。 知识星球:芒果纪要 物理物理AI数据在物理数据在物理AI的能力体系和产业链中分别扮演何种角色?的能力体系和产业链中分别扮演何种角色? 在物理AI的能力体系中,数据是贯穿五大核心环节数据是贯穿五大核心环节(感知、决策、验证、执行、反馈感知、决策、验证、执行、反馈)的基础的基础。例如,感知层通过感知设备与模型实现物理世界数据的采集、处理与输出;决策层则融合各类感知信息以执行策略。产业链层面,若将物理AI产业链划分为基础设施层、技术齿轮层、软硬融合层、行业应用层和运维服务层,数据层则构成了技术齿轮层(即能力中枢层)的基础底座。技术齿轮层进一步细分为数据层、模型层和仿真层,其中数据层为模型层与仿真层提供基础支撑,主要涵盖数据采集、数据标注和数据合成等环节,并有望衍生出数据交易与服务等业态。因此,数据层在物理数据层在物理AI的产业体系中占据了关键的卡位的产业体系中占据了关键的卡位。 物理物理AI数据与传统大语言模型所使用的数据在模态维度和物理规则层面存在哪些核心区数据与传统大语言模型所使用的数据在模态维度和物理规则层面存在哪些核心区别?别? 物理AI数据与传统大语言模型数据主要存在两方面核心区别。第一,在模态维度上,传统AI大模型所需数据主要为文本、图片等模态,而物理AI的具身智能数据具身智能数据除包含文本、视觉数据外,还涵盖了力觉、触觉、轨迹、时序等多模态数据。第二,在物理规则层面,物理物理AI数据的一个关键特性是必须满足物理世界的规则数据的一个关键特性是必须满足物理世界的规则。例如,机器人在执行抓取杯子的任务时,其视觉、力觉等多维度数据需要统一协调,并遵循摩擦力等物理定律。这一点是传统大语言模型数据较少涉及的,也因此导致物理AI数据的获取和应用难度远高于传统数字AI的训练数据。 当前物理当前物理AI训练数据的存量规模与传统大模型相比存在多大的差距?训练数据的存量规模与传统大模型相比存在多大的差距? 当前物理世界数据的存量与大模型训练数据之间存在跨数量级的鸿沟。根据第三方机构EN的统计,全球当前可用的机器人训练数据仅为240万级。与之对比,文本大模型的训练数据量已达到15万亿token级别,两者存在多个数量级的差距。另一组数据显示,相较于GPT-3约4,500万亿token的训练数据,目前全球最大的机器人开放数据集仅包含约100万条轨迹。尽管不同统计口径的单位存在差异,无法直接进行精确倍数比较,但这些数据明确显示,物理物理AI的可用训练数据规模与传统大模型相比存在巨大的差距的可用训练数据规模与传统大模型相比存在巨大的差距。 具身智能训练对物理世界数据的需求量级是怎样的,当前行业数据供给存在多大的缺口?具身智能训练对物理世界数据的需求量级是怎样的,当前行业数据供给存在多大的缺口? 具身智能训练的数据需求量级随技术路径的演进而急剧增长。在2022年至2024年的分模块训练阶段,所需数据量为万小时级别;进入2025年至2026年的端到端训练阶段,需求跃升至十万到一百万小时级别;而未来由世界模型驱动的技术路径,则需要千万甚至上亿小时级别的数据。当前行业面临巨大的数据缺口。一方面,机器人从仿真环境到现实应用的成功率存在显著的“现实鸿沟”,斯坦福的报告显示,仿真环境中89.4%的成功率在真实环境中会骤降至12%,存在77%的差距,这凸显了对高质量真实世界数据的需求。另一方面,行业共识认为,具身智能的数据供给存在显著缺口。 具身智能的数据缺口现状具身智能的数据缺口现状 具身智能达到真正可用的阶段至少需要一千万小时的真实场景交互数据,但目前整个行业内真实、高效、具身智能达到真正可用的阶段至少需要一千万小时的真实场景交互数据,但目前整个行业内真实、高效、高质量的数据存量仅为几十万小时,大约在五十万小时的量级。高质量的数据存量仅为几十万小时,大约在五十万小时的量级。即便部分公司声称拥有数十万小时数据,其可用性也存疑。因此,以高质量物理世界数据为标准衡量,当前数据缺口至少达到二十倍。若要实现“开箱即用”的更高目标,所需数据量将达到亿级,缺口会进一步扩大。 2026年上半年一级市场投资情况年上半年一级市场投资情况 2026年上半年一级市场对具身智能及相关数据领域的投资热度如何,资本关注点有何变年上半年一级市场对具身智能及相关数据领域的投资热度如何,资本关注点有何变化?化? 2026年上半年,一级市场对具身智能赛道的投资热度非常高。国内该赛道的总融资金额突破九百亿,达到935亿元,与2025年上半年相比,同比提升了五倍。资本的关注点正从传统的机器人本体和模型,延伸至更为底层的物理AI数据基础设施。市场认识到,无论是世界模型、本体开发还是未来机器人在各行业的应用,数据层都是关键瓶颈,若无法突破,后续发展将受限。一个标志性案例是被称为“数据英伟达”的光能智能,该公司在2026年上半年迅速完成两轮融资,总额达20亿元,A+轮融资后估值已达到150亿元。这一现象表明,资本正用实际行动证实物理AI数据因其稀缺性而具备强大的产业趋势,并开始重点布局数据基础设施领域的投资机会。 物理物理AI数据的采集方式与优劣势数据的采集方式与优劣势 当前物理当前物理AI数据的采集方式主要有哪几类,各自的优缺点是什么?数据的采集方式主要有哪几类,各自的优缺点是什么? 以保证规模和控制成本为原则,当前物理AI数据的采集方式可分为四类: 1.人类或互联网视频数据人类或互联网视频数据:规模巨大、成本极低,但由于缺乏动作维度的数据,精确度较差。2.仿真合成数据仿真合成数据:通过仿真软件、物理引擎和视觉模型共同生成,成本高于互联网视频,规模相对较小,但未来技术成熟后规模潜力巨大。3.便携式采集数据便携式采集数据:主要依赖摄像头、传感器、数据手套等设备(如ego、umi)进行采集,这类数据在模态和传感器层面已接近真实机器人数据,但与机器人本体采集仍有差距,因其需要针对特定机器人进行适配。4.真机遥操作数据真机遥操作数据:即直接由机器人本体进行数据采集,例如通过外骨骼或遥控器操控。这类数据最为精准,但缺点是成本极其高昂、效率低下,难以满足当前快速发展的需求。 物理物理AI数据采集与应用的核心挑战数据采集与应用的核心挑战 物理物理AI数据在采集和应用上面临哪些核心挑战?数据在采集和应用上面临哪些核心挑战? 物理AI数据在采集和应用上面临三大核心挑战: 1.物理数据特性带来供给刚性缺口物理数据特性带来供给刚性缺口:物理世界数据存在高噪声问题,并且必须严格满足物理规则,其多模态的强耦合性对技术提出了很高要求。这导致物理AI数据难以像数字AI数据那样通过复制或爬虫等方式快速获取,造成了其供给的刚性缺口。2.缺乏统一评测标准,产业非标准化缺乏统一评测标准,产业非标准化:在数据采集层面,每种采集方式都存在固有的利弊,目前行业内缺乏一个统一的数据评测标准。这意味着投入大量成本和人力采集的数据,无法保证其最终的可用性,导致整个产业目前仍处于非标准化阶段。3.标准缺失引发巨头竞争标准缺失引发巨头竞争:行业标准缺失也引发了巨头间的争夺,例如英伟达意图构建行业系统底座。在当前产业发展的初期阶段,率先取得进展的公司有望占据行业领先位置。 实上的标准制定者。 面对物理面对物理AI数据在质量和规模上的双重挑战,行业未来的破局方向可能是什么?数据在质量和规模上的双重挑战,行业未来的破局方向可能是什么? 物理AI数据破局的关键在于同时解决质量和规模两大问题。短期内完全依赖仿真合成等技术突破来实现这一目标可能性不大,因为技术沉淀需要时间。因此,一个更可能快速落地的解决方案是采用成熟技术并结合商业模一个更可能快速落地的解决方案是采用成熟技术并结合商业模式创新式创新。具体而言,通过**“ego+umi”的模式**,即利用头戴式摄像头(如GoPro)、数据手套以及带有传感器的可穿戴设备,由人类直接进行数据采集。这种方式的核心优势在于,它摆脱了对高成本机器人本体的依赖,将成本中心从昂贵的硬件转移到相对较低的人力上,从而能够在保证数据质量的同时,快速扩大数据采集规模。 在物理在物理AI数据采集中,如何解决专职采集人员效率低、劳动力不足的问题数据采集中,如何解决专职采集人员效率低、劳动力不足的问题?当前有哪些主流当前有哪些主流的商业模式创新的商业模式创新? 为解决劳动力不足的问题,商业模式创新是当前解决紧迫性刚性缺口的首选方式,主要体现在众包模式的应用。这种模式并非新生事物,在2015年左右的数据交易领域已有探索。具体到物理AI数据采集,可行的模式包括: 1.影子采集影子采集:在现有运行的机器人或终端设备后台静默运行算法,回传相应数据,这是一种增量的数据获取方式。2.便携式众包采集便携式众包采集:个人购买或使用手套等便携式设备进行数据采集并上传平台以获取报酬。这种模式结合了ego(便携式设备)和UMI(通用机械臂接口)的理念,旨在降低采集门槛。3.专业众包采集专业众包采集:类似海天瑞声正在进行的试采模式,由专业的职业数据采集人员完成。通过构建众包平台,可以吸引更多劳动力参与,有效解决劳动力短缺问题。 此外,还包括游戏化任务等多种商业模式创新,其核心目标是摆脱对专职人员的依赖,提高数据采集效率。 从中长期来看,物理从中长期来看,物理AI数据采集领域的技术发展趋势是什么数据采集领域的技术发展趋势是什么?除了商业模式创新,还有哪些除了商业模式创新,还有哪些技术范式有望成为主流技术范式有望成为主流? 从中长期视角看,技术范式的革新是解决数据采集问题的根本方向技术范式的革新是解决数据采集问题的根本方向,其中以世界模型加仿真的方式最被看好,有望成为未来的主流。该路径主要依赖仿真和合成数据,其优势在于能够彻底解决对真机的依赖以及劳动力不足的问题。尽管当前该技术路径仍面临虚实鸿沟较大、训练数据不足等挑战,但其长期潜力巨大。合成数据被认为是未来数据获取的主要方式之一。 物理物理AI数据与传统数字时代的数据要素相比,其独特性体现在何处数据与传统数字时代的数据要素相比,其独特性体现在何处?为什么物理为什么物理AI数据可能数据可能更容易实现资产化和商业闭环更容易实现资产化和商业闭环? 物理AI数据或物理世