具身智能模型持续进步,行业商业化突破有望加速 核心观点 ⚫具身智能模型呈现持续迭代,有望加速机器人商业化应用进展。具身智能区别于传统AI,需要具备认知、协作和学习三个功能,实现环境中自主进化的智能闭环。以具身大模型为代表的“大脑”技术是机器人规模化进入工业生产、社会服务、家庭生活等应用场景的认知能力基础。但目前市场投资者普遍担心由于数据瓶颈问题,具身大模型的进展可能不及预期,导致机器人行业商业化进程缓慢。我们看到当前产业链中部分厂商已在仿真数据、互联网数据应用上取得一些积极进展,并不断提升大脑模型的泛化能力,我们认为在工业制造、商用服务等领域,机器人行业商业化应用进展有望加速,带来投资机会。 杨震执业证书编号:S0860520060002香港证监会牌照:BSW113yangzhen@orientsec.com.cn021-63326320 ⚫具身智能模型技术路线虽有差异,但追求高泛化性逐渐成为共识。具身智能要构建一个通用大脑,目前主要的技术路线包括:分层大模型、端到端大模型和世界模型三种,而行业内尚未形成统一、成熟的技术共识及竞争格局。但整体而言,我们看到了各具身智能模型技术路线之间虽有差别,但呈现一定的融合趋势,追求泛化能力成为具身智能模型的一点共识。我们认为从工业到商业、家用等应用场景,机器人的泛化能力要求越来越高,这种能力将成为具身智能模型商业化的关键,具备高泛化模型的整机厂商更容易在市场竞争中取胜。 敬希癸执业证书编号:S0860125120011jingxigui@orientsec.com.cn ⚫降低高质量数据的成本逐渐成为行业探索的共识方向。为实现更优的泛化能力,大量高质量的训练数据将成为模型竞争的关键。当前的行业中已有部分厂商围绕仿真数据、互联网数据开展大量的研究,例如银河通用坚持仿真合成数据为核心,千寻智能注重互联网数据的使用,自变量机器人HOST框架支持从单条人类视频中获取技能。我们认为当前阶段,真机数据的积累有望构成整机厂商竞争的壁垒,真机数据更丰富的厂商在具身智能模型上具备一定的先发优势。仿真数据、互联网数据技术路线对于一些初创的机器人公司具备更强的探索价值。 特斯拉机器人生产有望加速,关注零部件企业生产管理水平:——机器人产业跟踪2026-07-14 投资建议与投资标的 展望未来,我们认为在汽车制造、物流仓储等垂类应用场景里,由于工作任务相对明确、对机器人泛化能力要求相对不高,因此有望率先实现规模化应用,垂类场景下具备丰富的行业数据,以及行业Know-how的具身智能厂商具备先发优势,有望率先大规模商业化。但我们认为这并不构成完全的竞争壁垒,区别于传统机器人和具身智能的关键之一是智能的自主决策,因此未来不排除模型泛化能力更强的整机厂商通过与垂类行业合作,进行降维打击。向前看,我们认为在垂类场景积极布局的具身智能厂商以及模型泛化能力更强的整机厂商,有望取得更大的竞争优势。相关标的:上纬新材(688585,未评级)、优必选(09880,未评级)、埃斯顿(002747,未评级)、杰克科技(603337,未评级)、杭叉集团(603298,买入)。 风险提示 模型发展和数据积累慢于预期风险、场景需求落地不明确风险、厂商生产不及预期风险、国家政策变化风险、行业融资不及预期风险 目录 1.具身智能模型持续迭代,泛化能力有望持续提升........................................4 1.1当前具身智能模型,呈现多种技术路线并行.................................................................51.2具身智能模型虽有差异,追求高泛化性逐渐成为共识..................................................9 2.具身智能数据仍存在瓶颈,行业积极探索降低数据成本...........................13 3.投资建议..................................................................................................16 风险提示......................................................................................................17 图表目录 图1:具身智能应用拓展对具身大模型泛化能力提出更高要求.....................................................4 图2:具身智能技术框架..............................................................................................................4图3:目前具身智能模型技术路径行业内尚未统一.......................................................................5图4:智元机器人GO-1模型呈现分层架构..................................................................................6图5:典型VLA模型架构.............................................................................................................6图6:端到端的VLA模型目前有多种技术架构.............................................................................7图7:逐际动力具身智能大脑系统采用了三层架构.......................................................................8图8:逐际动力Oli机器人整理家务..............................................................................................8图9:世界模型的技术范式可以概括为两条互补的发展路径.........................................................8图10:世界模型可理解为模拟器、渲染器、规划器等三类功能...................................................9图11:谷歌RT-2模型具备端到端的能力...................................................................................11图12:Figure AIHelix 02模型三系统VLA架构 .........................................................................12图13:特斯拉正将全FSD的积累扩展至具身智能领域..............................................................12图14:银河通用数据金字塔结构................................................................................................14图15:自变量机器人HOST框架支持从单条人类视频中获取技能.............................................15 表1:国内具身智能厂商模型的技术路线存在差异.......................................................................9表2:具身智能主要数据类型.....................................................................................................13表3:当前具身智能真机数据采集方案主要包括遥操作数据采集、开放环境采集和动作捕捉三种 表4:国内具身智能厂商已在多个场景探索布局.........................................................................16 1.具身智能模型持续迭代,泛化能力有望持续提升 具身智能已成为全球关注的科技前沿。据国际电信联盟定义:具身智能指与物理实体融合的人工智能,能够自主与物理世界交互并适应环境。从智能能力上看,具身智能需具备认知、协作和学习三个功能。目前产业内常将具身智能组成拆分为大脑、小脑和本体三部分,以具身大模型为代表的“大脑”技术是机器人实现理解交互、自主决策、任务规划,规模化进入工业、商业、家庭等应用场景的认知能力基础,以具身本体智能模型为代表的“小脑”技术则是机器人能够高稳定性、高灵活性地完成各项复杂任务的运动能力前提。我们认为要实现具身智能更广泛的应用,需要持续提升机器人模型跨场景、跨任务和跨本体的泛化能力。 具身智能需要具备环境中自主进化的智能闭环,这对模型和数据提出了更高要求。传统大语言模型交互模式为“输入数据-输出答案”,而具身智能具备了物理本体,其交互模式有望形成智能闭环:本体被部署到真实场景中→在执行任务中收集真实行为数据→高质量数据被用于模型训练和迭代→更通用的模型被部署到更多的机器人上,从而收集更多、更高质量的数据。在这个过程中,“数据-模型-本体”是三个关键技术要素。其中,数据是闭环飞轮启动起点,大脑能力和大小脑协同是现阶段智能的核心瓶颈。 图2:具身智能技术框架 1.1当前具身智能模型,呈现多种技术路线并行 具身智能行业已围绕“通用大脑”开展了广泛的技术创新。具身智能要构建一个通用大脑,目前主要的技术路线包括:分层大模型、端到端大模型和世界模型三种,行业内尚未形成统一、成熟的技术共识及竞争格局。分层大模型路线上,用LLM、VLM作为“大脑”进行任务推理和规划,并通过API调用相应的动作策略。端到端大模型路线上,端到端的VLA(Vision-Language-Action)模型,将视觉、语言和动作统一到一个学习框架,根据视觉观测和自然语言指令输入,端到端地输出动作,该模型旨在绕过传统的显式状态估计与符号规划环节,尝试建立从高维感知输入到低层控制指令的直接映射,在处理未知任务时表现出良好的泛化能力。世界模型路线上,通过构建机器人对物理环境的内在认知模型,实现环境预判、时序推理与自主规划,核心意义在于赋予智体“内在的世界理解与模拟能力”,能够在与环境交互过程对应的高维、多模态的感知数据中提取物理规律、因果结构与环境动态,从而形成可用于推理与规划的内部表征,进而提升决策性能。 分层大模型技术上相对易实现,但可能存在响应延迟等问题。分层架构将感知、决策、运动控制解耦为独立模块,高层任务规划负责语义理解与行动决策,底层运动控制专注动作执行。如CLIPort,借助CLIP在图文对齐上的预训练能力,该模型可以通过自然语言指令直接生成操控动作,在少量样本条件下即表现出良好泛化能力。分层架构具备工程实现难度低、系统可控性强、数据需求相对较小等优势,适配行业发展早期数据稀缺的产业现状,但该路线可能的缺陷在于各模块之间缺乏统一的表示空间,难以实现语言、视觉与动作之间的深层语义对齐,