您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [-]:具身智能技术及产业实践的阶段性进展 - 发现报告

具身智能技术及产业实践的阶段性进展

信息技术 2026-04-17 - - 起风了
报告封面

发展趋势与现状 “大模型”技术范式与Scaling Law,2020~ 当前技术方案:以语言大模型为中心,引入视觉文本数据、机器人演示数据进行联合微调 代表工作:VoxPoser(斯坦福李飞飞组)、PalM-E& RT-X (谷歌)、𝜋!(Physical Intelligence)、HUME (上海交通大学)、EmbodiedGPT(上海浦江实验室)、RoboBrain&HybridVLA(北京大学)、RoBridge(中山大学) 为什么具身智能在当下爆发 国家政策:打造具身智能基础设施,加速产业升级 Ø2025年“具身智能”首次写入政府工作报告和十五五规划,全国20个省市纷纷出台专项政策布局具身智能产业Ø具身智能数据训练场建设成为发展共识,一脑多机的通用具身智能平台应用是关键核心能力 强化技术主权竞争,推动新质生产力发展,构建国际标准话语权 国家战略 催化全行业数智化转型,制造业智能化跃迁,战略新兴产业孵化器 产业升级 突破Al落地瓶颈,弥合仿真与现实的“鸿沟”,推动多学科交叉创新 技术突破 什么是具身智能?----AI从虚拟走向物理的关键跨越 具身智能是指智能体通过物理实体与环境实时交互,实现感知、认知、决策、行动一体化的智能系统。其本质在于“身体”与“智能”的深度结合。 什么是具身智能?----AI从虚拟走向物理的关键跨越 具身智能是指智能体通过物理实体与环境实时交互,实现感知、认知、决策、行动一体化的智能系统。其本质在于“身体”与“智能”的深度结合。 具身智能:从数字空间到物理世界 离身智能:模型被动感知数字空间,无法直接改变环境并作用于物理世界。 具身智能:智能体主动理解物理世界,通过适应性行为和自主学习来完成任务。 具身智能:从数字空间到物理世界 n具身智能:突破传统机器人大规模应用瓶颈的关键技术,实现通用人工智能的必经之路 具身智能的核心难点I:平台与数据缺 高质量仿真平台 •多类型机器人的数据集格式不统一•多种控制对象或多种任务的数据难以兼容•数据与任务规模有限,限制了模型训练 •缺乏复杂的环境交互 •任务和指令的多样性不足 真实性、交互能力、场景多样性不足 具身智能的核心难点II:感知与决策难 复杂操纵 空间推理 请帮我把卫生间洗手台上的布洗干净,并帮我把厨房冰箱上的面包放到微波炉。 GPT-4o推理 •工业产品种类不同•机器人种类不同抓取失败•环境干扰不同抓取失败 具身感规控一体化基础模型 具身基础模型:旨在实现能跨越不同任务、不同本体、不同场景,具有泛化能力的具身智能体。 2024年3月,谷歌发布具身基础模型RT-H,通过将复杂任务分解成简单的语言指令,再转化为机器人行动,来提高任务执行准确率。 2024年10月,清华大学发布双臂操纵机器人扩散基础模型RDT-1B,能够对未见过的目标和场景,表现出零样本泛化能力。 2024年鹏城实验室发布国内首个操纵大模型在多级别操纵任务上的准确率比字节的GR-1高23.1%,比谷歌的RT-1高19.5% 2024年10月,PhysicalIntelligence发布视觉-语言-动作(VLA)具身基础模型π0,π0使用了互联网规模数据预训练,并用高质量精细数据微调VLA模型,能够高效执行复杂任务。 VLA:从语言世界到物理世界,但停于“看到”不是“真懂”真实物理世界 世界动作模型成为业界突破大脑瓶颈的重要探索 世界动作模型 科学问题与面临挑战 多模态大模型在物理世界的推理与交互能力不可控、存在幻觉(Hallucination)现象,这对于安全敏感场景风险巨大:难以追因溯源、缺乏理论支撑 挑战 研究思路 具身智能:重点研究领域 构建虚实人机互动环境,打造具身基础模型,推动算力网应用从赛博走向现实。 具 身 智 能研 究 进 展02 研究进展一:高效超长序列建模世界模型基础架构 目标:提升世界模型生成与执行的可靠性、可控性 贡献:针对语义与生成可控问题,构建显式语义概念体系与生成过程可控机制 研究进展一:高效超长序列建模世界模型基础架构 Ø在one-hot单纯形上实现了严格的扩散过程,直接在离散空间中进行去噪,而不是依赖嵌入或掩码,也不依赖马尔可夫性 连续记忆计算、对称记忆计算 研究进展一:高效超长序列建模世界模型基础架构 研究进展二:物理规则驱动的空间感知与推理 构建物理规则驱动的空间感知与推理模型,提升具身智能体任务规划与执行的可靠性 复杂指令:请把浴室里的毛巾拿出来,放到客厅的箱子里,然后把客厅的书拿出来。 问题:我把浴袍落在浴室的哪里了?智能体:它挂在墙上的挂钩上。 研究进展三:大模型内在机理驱动的多智能体协同 目标1:让智能体协作从“试验可行”→“稳定可靠” 贡献:针对幻觉多、协作失效问题,提出多智能体自主分工协同框架 研究进展三:大模型内在机理驱动的多智能体协同 目标2:智能体推理从“快而不稳”→“高效可靠” 贡献:突破效率与可靠性互斥瓶颈,提出具备快慢思维的认知推理智能体 研究进展四:高质量具身数据生成与仿真 提出新型桌面3D场景生成框架,通过引入认知拓扑推理链和物理感知去噪对齐技术,确保生成的场景既符合真实物理规律,又能与用户的指令语义高度一致 研究进展四:高质量具身数据生成与仿真 为了解决现有仿真平台资产匮乏、交互能力不足的问题,整合了生成式3D资产构建、Real2Sim场景重建和统一3D资产管理技术。 领先的3D扫描与重建技术,助力现实场景的便捷虚拟化。 导航与抓取 机器人家族 场景编辑 l10W+高质量物体资产l无限的可控式交互物体生成与文本物体生成l支持90+种多样的机器人l丰富的机器人交互方式 即开即用的大规模室内外场景,包含医院、办公室、仓库、工厂、城市等海量场景。 l文本场景生成+物体编辑/替换,实现场景的无限扩增l200+纹理/背景/材质自由替换,场景量×200+ 研究进展四:高质量具身数据生成与仿真 支持室内、室外、定制化、桌面等各种级别场景的仿真 研究进展四:具身智能通用数据标准及数据集 300多万条具身操作轨迹258个场景,32万个任务 优势 研究进展五:基准与评测 仿真平台难以对齐真实物理世界 真实物理平台的系统性瓶颈 •机械臂价格昂贵,机械臂差异影响评测公平•无法摆脱人在回路,运作需要操作员监督•评测泛化性受限于固定化的指令•评测指标缺乏客观性、可解释性 •视觉和物理真实性受限,无法完全模拟真实世界 •场景和资产类型单一、缺乏复杂的环境交互•高质量仿真数据生成能力不足 研究进展五:基准与评测 VLA模型比想象的更具普适性:重新审视物理和空间建模 研究进展五:基准与评测 真实世界验证 •1条轨迹微调:拾取积木、堆叠积木、关闭微波炉门、按按钮、拉抽屉) 持续迭代的场景化的多种类、不同规模的系列模型 Vidman: Exploiting implicit dynamics from video diffusion model for effective robot manipulation RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model, 2025 基于自适应视角规划的机械臂操控模型,2025 过程奖励引导的VLA模型推理增强框架,2025 核心基础:国产自主可控的具身智能科产融合生态体系 跨机器人跨场景的大规模预训练平台,构建与真实场景同步的机器人模拟技能库,支持多种机器人形态和原子操作,生成海量演示数据,实现跨机器人跨场景的大规模预训练。 核心技术总结|虚实融合具身数据生产平台 针对现有具身数据集规模小、质量差等问题,研究具身数据高效采集与生成技术,构建超大规模虚实融合具身数据集,支撑具身大模型的训练与验证 场景落地|软硬一体化按摩机器人 深入软硬协同,实现从“感知精准”到“执行专业”的跨越。不仅仅是复制动作,而是复制专家级按摩师的“力度节奏感”和“体感记忆”。 目前已实现: ü背部展油ü点按膀胱经ü指推膀胱经ü跪推膀胱经ü拨腰肌ü手部展油ü推上臂ü推下臂 场景落地|软硬一体化柔性包装机器人 面向柔性包装的全链路,完成折盒成型、物品装填、缓冲材料填塞的全链路自动化操作,适配多品种、变工况的柔性包装需求。 场景落地|虚实迁移具身智能原型系统 基于具身仿真训练与真机迁移部署,实现多任务导航、真机灵巧操作等关键技术,支撑高通用性交互与操作应用 具 身 智 能 的 产 业 实 践03 时代背景:新一代AI技术正加速变革劳动力市场需求 《人工智能趋势报告(Trends–Artificial Intelligence)》-Mary Meeker2025.5 机器替人 AI正在替代传统岗位,同时催生新职业机会。未来十年内,将减少8300万个工作岗位,6900万新岗位产生。采用人工智能技术,一定程度的体力劳动或人际交往,被机器人或智能软件所取代或辅助。国内机器人产业招聘职位数同比增长409%,而市场上具备相关技能的人才供给增长仅为28% AI的影响力正迅速超越纯粹的数字领域,深刻渗透并重塑我们身处的物理世界。具身智能——即由AI驱动、能够与环境互动并执行物理任务的系统——正在兴起。 以OpenAI的ChatGPT为例,这一AI浪潮的典型代表在2025年4月已拥有8亿周活跃用户。其全球扩张速度令人瞩目:仅用三年时间。 发展背景:打造具身智能基础设施,加速产业升级 机器人岗位化 远程打工人 通过VR设备实现跨地域精准控制机器人执行复杂任务,为高风险场景提供“风险兜底”方案,结合自主化路径实现高效人机协同。 通过“岗位化设计”实现迎宾、配送、搬运、家务等特定职能的专业化服务。 发展背景:资本大量涌入 产业规模预测 2025年82亿中国人形机器人市场 平均每天2起融资、3亿元流入单笔10亿+融资达14 2026年万亿 2030年4000亿中国市场规模 2035年万亿+全球市场突破 还有帕西尼、自变量、逐际动力、云深处、众擎、光轮智能等6家百亿独角兽 "每天3亿元砸向具身智能,10亿级融资只是入场券" 发展挑战:具身智能产业应用的“三大难题” n物理仿真保真度瓶颈和海量高质量数据匮乏:异构智能体的训测依赖对真实物理世界的感知与交互,高昂的数据成本和地成熟度的智能化水平,无法支持产业良性发展。n缺乏高效的持续演进平台和大规模算力支撑的云服务:异构智能体的进化,缺乏支撑协同训练与持续演进的仿真环境和大规模算力,无法进行高效迭代学习 实验室Demo ≠工业现场可用 数据采集成本高 场景泛化能力不足 l存在虚拟到现实的鸿沟,导致具身无法应用实际场景l智能化水平不足,具身机器人可用性低 l当前机器人训练依赖真实场景数据采集,成本高昂,当前具身数据采集成本约500元/小时 l同本体在不同环境空间泛化能力不足l同场景下不同本体之间的泛化困难 给职业院校的启示:企业不缺"造机器人"的博士,缺"让机器人跑起来"的工程师,从技术到应用,隔着一道"工匠鸿沟"。 具身智能发展亟需技能型人才推动场景落地 2025年中国制造业十大重点领域人才需求预测 产业现状 需求侧:新质生产力加快形成供给侧:高技能人才供给水平不足 数据来源:教育部、人力资源和社会保障部、工业和信息化部《制造业人才发展规划指南》 《中国特色高水平高职学校和专业建设计划(2025—2029年)实施方案》教育部财政部2024年8月 目标:办学能力「高水平」产教融合「高质量」 校企共同优化专业群人才培养方案和课程体系,培养更多与区域经济社会相适应、与新质生产力发展相契合的高技能人才。 利用人工智能等技术,建设数字远程实训平台和虚拟仿真实训基地。基于企业生产真任务、真场景,研究开发生产性实训项目。 建