发布时间:2026-08-20 一、AI总结内容 一、核心要点 1. 物理AI是AI从数字世界向物理世界外溢的新方向,包含世界模型、机器人、自动驾驶、空间智能等,2025年及未来数年为重要发展期,当前核心下游场景为自动驾驶与机器人。 2. 物理AI具备多层次核心能力,一是感知能力,通过摄像头、激光雷达、各类传感器获取环境信息,服务后续动作执行而非仅识别;二是理解能力,需掌握三维空间、物体关系、物理规律,区别于传统大模型的文本图像知识学习;三是任务规划能力,可拆解复杂任务、动态调整策略,与世界模型关联紧密;四是执行能力,通过物理载体完成移动、抓取等动作,是机器人产业链价值核心。 3. 物理AI是系统工程,发展不仅依赖算法,还受数据、训练平台、本体控制能力等多因素影响,世界模型在2025年发展较快,VLA模型可将视觉语言模型与机器人控制数据结合,打通从感知到动作环节。 4. 世界模型可理解物理世界、推演动作后果、生成仿真合成数据,能降低训练成本、覆盖长尾场景,英伟达Cosmos是代表性世界模型平台,是物理AI基础设施。 二、投资线索 1. 海外公司:英伟达侧重构建物理AI全栈生态,覆盖算力、仿真、模型层;特斯拉依托自动驾驶与制造体系发展Optimus机器人,偏向落地应用,优先在工厂场景验证;海外新势力推动机器人产业从硬件工程向软件模型驱动转变,如Fig AI、Physical Intelligence等。 2. 国内公司:银河通用是仿真合成数据代表,聚焦机器人基础模型、仿真平台与操作能力,打造数据-模型-部署闭环;语数科技产品布局全面,注重工程化能力与产品矩阵建设;五五一世界从数字孪生、仿真训练平台切入,对标英伟达Omniverse、Cosmos,支撑自动驾驶与机器人训练;群核科技(酷家乐)拥有大量真实室内空间数据,布局空间智能,可赋能机器人训练与空间服务。三、风险与关注 1. 物理AI当前处于商业化前期,大规模落地尚需时间,核心瓶颈为数据匮乏,真实机器人部署数据成本高,需等待数据飞轮形成。 2. 物理AI及世界模型技术迭代快速,存在技术路线竞争风险,不同企业布局路径存在差异,需跟踪技术进展与商业化落地节奏。 二、音频原文(转写) 大家好,欢迎参加国泰海通计算机下一个万亿赛道物理AI及世界模型。目前所有参会者均处于静音状态,下面开始播报声明。本次电话会议仅服务于国泰海通证券正式签约客户会议音频及文字记录的内容,仅供国泰海通证券客户内部学习使用,不得外发,并且必须经国泰海通证券研究所审核后方可留存。国泰海通证券未授权任何媒体转发此。 在电话会议相关内容未经允许和授权转载、转发均属侵权。国泰海通证券将保留追究其法律责任的权利。国泰海通证券不承担因转载、转发引起的任何损失及责任。市场有风险,投资需谨慎。 提醒广大投资者谨慎做出投资决策。嗯,各位呃领导晚上好,我是国泰海通计算机分析师朱瑶。呃,我们今天 呃汇报一下这个物理A I跟 呃,世界模型的这个呃方向内容。嗯,然后。 嗯。呃,主要背景是过去呃两年这个AI呢以大语言模型 呃,再到这个呃,东福泰模型。再到现在这个。AI agent啊都在快速的发展。 那主要也是推动这个AI的能力在呃文本代码。图像、视频啊,这些领域的。呃,这些数字世界里面去。啊,实现这个智能能力的一个体现。 啊,那么我们觉得 呃,这个未来的下一个AI产业的这样的一个趋势。呃,重要变化我们觉得。啊,大模型能力它也会逐渐的从。数字世界 呃,去这个呃真实的这个物理世界去外溢。 呃,所以A I它呃不仅仅只是在这个数字世界里面能够理解信息跟 呃,调用工具。啊,而是能够进入到真实的这个物理世界里面啊,从。呃,感知环境再到 呃,理解这个空间再到。呃,去规划任务以及呃,控制相应的这个。 去升智能体啊,去完成这个物理动作。啊,所以我们把呃这个 呃,比较广泛的这样的一个方向啊,包括呃这个世界模型,包括这个。呃,机器人自动驾驶啊,空间智能啊,这些。呃 跟这个呃物理世界的这样的一些呃AI智能化呀,这样的一个。 あ 大的这个方向,我们觉得都能把它归到这个物理AI这个。啊,范畴里面。啊,那我们觉得整体上来讲呢,我们觉得物理A I呃,在这个呃,在今年以及到 呃,这个未来二二八三零年,我们觉得都会是一个 啊,相对比较新的一个方向。呃,那目前他可能主要 的一个下游的这个 代表的。 场景呢是这个自动驾驶跟 呃,机器人。那这个是整个的一个呃概概述的一个情况。那我们觉得 呃,物理AI有哪一些这个核心的这个能力?嗯,因为他其实是要 去理解这个空间结构。 呃,然后也要再符合这个物理。呃,这个 呃 数据的这样的一个约束的,以及包括说跟这个呃现实不确定的环境去做交互。呃,所以我们觉得,呃,物理AI它的这个 呃,能力其实是多层次的。嗯,首先 呃,我们觉得是需要具备呃一定的这个感知能力。 嗯,那么在感知能力这一侧的话。呃,物理AI需要 通过像摄像头 像激光雷达,像传感器。啊,包括这个力觉、触觉的感传感器。啊,去获取外部环境信息。 啊,能够识别物体。空间路径障碍物 啊,以及这个人类行为跟 啊,任务状态。呃,那么相比过去我们说啊,视觉A I 啊,我们觉得其实 呃,物理A I它的这个感知呢,并不仅仅是停留在 呃,识别。这个层面。 啊,而是为了要呃服务后续的这个动作执行。啊,去服务。那举一个例子来说的话,呃,比如说像 啊,机器人。啊,它不仅需要去识别。 啊,杯子。啊,他呃作为这个物理AI的这样的一个感知能力 嗯,他是要去判断这个杯子的。把位置 啊, 材质啊,是否这个呃,这个机器人的这个呃,机械笔可以进行抓取。以及抓取之后,呃,会产生什么样的一个啊,后果是不是会从这个呃手上去滑落? 这些其实也是要呃有这个感知能力来进行这个数据方面的这个采集。那么 呃,除了这个感知能力之外的话啊,其实还需要有 呃,这个理解能力。那这个也是我们。所说的这样的一个。 呃,包括这个空间智能的这样的一个理解能力。呃,物理AI需要去对这个三维的空间。呃,物体的这个关系。啊,场景呃语义以及物理规律去做充分的这个理解。 那这个。嗯,也跟数据啊有一定的这个相关啊。传统的大模型呢,主要是 从文本和 啊,图像里面去学这个知识。呃,但是呃,物理A I的话,它其实需要 进入到这个真实世界里面去采集数据,去学习。 呃,真实世界的这个 啊,三维空间跟这个啊物理的这个规律。啊,所以呃,这个理解能力我们后面会 从这个空间智能这个方面来进行一个讲。あ。啊,然后我们觉得 呃,物理AI的话,它还需要具备这个任务规划的这样的一个能力。 嗯。需要将这个 呃,复杂的这个任务去。呃,拆解。成一个个可以执行的。 呃,子任务并且呢能够 根据环境的反馈,呃,动态调整策略。呃,比如说像 家庭里面的这个整理的任务。啊,机器人需要先啊识别家庭的环境。那确定。 目标物体的位置。再去规划啊,机器人的移动路径啊,抓取方式。和放置的位置。那如果说 任务的这个过程当中。 呃,发生了。像物体掉落,或者说 啊,所交互的这个环境的状态发生变化的话。啊,还需要能够进行重新的啊任务规划。所以它相比。 啊,传统机器人它依赖的是一个 呃,固定的程序和呃规则的控制。呃,物理AI呢,它的这个呃规划能力要更 更强调基于。啊,模型的推理。以及呃任务的分解,以及这个。 啊,对于 嗯,失败任务的一个恢复调整的能力。所以,呃,规划能力我们觉得这个。会跟呃世界模型。啊,会更密切相关。 呃,那么第四个是这个呃执行能力。嗯,因为呃物理A I其实是跟呃真实世界去产生动作跟交互。啊,所以他必须要通过。物理载体去完成动作的执行。 啊,包括呃移动啊,啊抓取 包括 呃,搬运装配啊等等,就这些动作呢,其实都 呃,跟不同的这个下游的应用场景。啊,相关系,所以呃,这个执行。执行的这个呃能力其实也是。呃,物理A I它区别于 我们呃过去所说的这种数字世界的这个A I A I A D 啊,是有有区别的一个重要的一个环节。 那么这个也是现在这个。呃,机器人产业链里面啊,价值的一个主要的一个部分。所以只有呃,这个呃,这个 软件大模型。和这个呃机械呃结构 呃,和这些传感器这些结结合起来啊,然后使得这个物理AI的那个能力,呃,真正的进入到 啊,真实世界。 呃,所以我们觉得 呃,物理AI呢它 它本质上呃不是一个。呃,不仅仅是一个呃算法突破啊,因为 呃。确实,今年呢也是。呃,有这个呃论文也是指出是说这个。 其实在这个物理AI在这个 呃,世界模型的这个领域呢,它也会 呃,遵循这个呃scan in law,所以通过更大量的这样的一个 呃,数据啊也能够使得这个世界模型的一个能力会 呃,有一个很大的提升。所以这个也是,呃,呃,今年其实在这个 呃,算法世界模型上有一些这个突破。啊,但我们觉得整个呃这个物理AI的这个发展呢。啊,他其实还是我们觉得是需要呃,这个整个 呃 呃,多方面啊,包括这个呃,世界模型啊,包括这个。 呃,这个 うん。感知 等等,是一个这个整个的,也是一个呃系统的这样的一个。啊,工程。啊,所以我们觉得 呃,这个也不仅仅。 呃,这个未来的这样的一个发展,不仅仅依赖于这个呃模型,也也来自于像 现在的这个呃数据啊,然后训练平台啊。呃,这个本体控制能力等等是一个。呃,比较 多因素的这样的一个呃,受到多因素的一个影响。呃,然后,呃,接下来就是,呃,汇报一下,就是我们怎么去看这个。 呃,几个重要的一个概念,像呃,空间智能,像 这个世界模型和这个矩阵智能。我们觉得这些能力呃结合起来的话啊,它是共同去组成这个物理A I。呃,从 呃,关系上来讲的话,我们觉得呃,物理AI它其实是一个 呃,我们觉得是一个概括性的东西,是一个 呃,目标啊能够让 这个目标就是让AI在 真实的物理世界去完成任务。那么。 呃,空间智能呢,它其实是一个 呃,认知的一个基础,或者说是一个 啊,能够让A I去理解 呃,包括这个生成和推理。这个三维空间物理世界的这样的一个。啊,能力。那么呃,具身智能的话,我们觉得会更加侧重于说是这个。 呃,物理A I的一个载体。啊,这些载体呃,包括说这个。呃,自动驾驶的车辆啊,包括这个机器人啊,这些是一个。呃,载体它能够跟真实的环境去进行交互。 呃。那说到这个呃世界模型的话,其实 呃 这个也是我们觉得世界模型其实是在今年会发发展比较快的一个方向。那么之前的这个 呃,机器人的 呃,领域的话它 也是从这个。呃,规则的控制啊,去去逐步的经过。 这个几轮的这样的一个技术迭代。那么在这个呃世界模型之前的话,其实 嗯,行业里面说的比较多的是包括这个。啊,VR A模型。呃,就是机器人它 呃,从这个呃 按照这个规则的一个指示,然后再到之后去生成这个。 啊,动作。那么。像这个V R A的话呢,它 嗯。主要的一个从从从这个输入跟输出上来看的话呢。 吓 是输入是需要包括这个呃这个呃视觉信息,也就是也就是V代表着这个微信啊,然后还有包括这个语言指令,就是这个代表这个啊。Lan language就是这个L啊,然后这个A的话就代表这个action就是动作。所以呃这些也呃都是这个输入的这个呃层面的一些信息啊。那输出的话呢,其实它可以是这个呃机器人可以执行的一个动作的序列啊,也或者是。 是一些这个呃这个机器人可以去理解的这个控制信号。呃,比如说当呃用户发出把桌上的这个苹果放进篮子里面的这个指令的时候,呃,那那机器人它首先它需要呃去理解这个呃呃这个语言,然后呢它的这个呃视觉需要去识别这个呃苹果跟呃篮子的一个位置,然后通过这个呃再去再去去规划它的这个任务和。呃。呃,抓取的一个动作。 啊,然后去去。并并且去执行。动作 所以呃,相比传统的这个机型预设的这样的一个固定的动作模板的话。呃,这个V R A模型它的一个发展。 能够使 机器人在更加呃复杂、更加开放的这个环境中去执行操作的任务。呃,像 这个呃,谷歌的这个 积分曼的下面的这个R T二呃,是这个呃V I A模型。比较重要的早期的代表。哦。 他的这个核心的想法就是将 呃,视觉语言模型跟机器人的控制数据去结合。啊