发布时间:2026-09-05 一、AI总结内容 一、核心要点 1. 本次电话会为国海传媒AI培训框架系列三讲第一讲,聚焦2026年世界模型现状,旨在建立产业研究与投资判断的分析框架,后续两讲将涵盖技术演进路线、发展归途与评价体系 2. 过去18个月物理AI领域融资规模超100亿美元,海外头部项目单笔融资10亿美元级(估值约50亿美元),国内头部项目单笔数十亿元人民币级(估值超百亿元),资金投向包含模型、机器人本体、数据引擎等 3. 模型、数据、算力首次达相对可用阶段,模型侧Sora验证视频可作为世界学习载体,数据侧具身智能倒逼建立真机遥操等新数据供给体系,算力侧云端加端侧协同架构具备工程可行性 4. 行业共识:AI需从描述世界(next token prediction)转向预测世界演进(next state prediction),弥补对物理世界的感知、交互能力不足 二、关键框架与流派 1. 世界模型核心公式:当前状态(state)+动作(action)经预测器(predictor)得到未来状态/动作,不同流派差异源于state、action、predictor的选择 2. 主流分三派:2D视频派(OpenAI Sora等,靠数据红利但成本高、物理性弱)、3D空间派(Worldleaves Marble等,适配空间交互但数据稀缺、成本高)、隐空间派(Meta V2等,适配决策规划但需匹配商业化场景) 3. 按预测功能分三类:渲染器(给人看,用于影视游戏等)、模拟器(给机器用,用于自动驾驶仿真等)、规划器(机器自主决策,用于任务执行等)三、产业阶段与瓶颈 1. 三类模型阶段分化:渲染器接近GPT-3(进入产业落地付费阶段),模拟器接近GPT-2(场景生成但泛化性弱),规划器处于GPT-1到GPT-2过渡阶段(VR/AR起步,能力有限) 2. 短期核心瓶颈:高质量数据缺口(真实交互数据距1000万小时需求差20倍)、虚实迁移(sim-to-real)gap、统一评价体系缺失,数据引擎、自我改进闭环也待完善 四、落地场景与判断标准 1. 商业化最快场景为内容娱乐(广告、短剧、游戏等),其次为自动驾驶(仿真安全验证),具身智能空间大但仍处早期 2. 世界模型判断标准:需满足动作一致性、空间一致性、可交互性、闭环预测,因果与可交互性为门槛,物理准确性、泛化性为核心质量指标 二、音频原文(转写) 大家好,欢迎参加国海传媒模型系列世界模型3讲第一奖世界模型的现状外发报告新老产品周期切换。海外新品逐步放量三期沪于2026中报点评外发时间2026年8月29日下面开始播报声明。本次电话会议仅供符合国海证券投资者适当性管理要求的客户,以及受邀客户使用。国海证券不会因接收人收到本次会议相关通知或参加本次会议而视其为客户。 本次会议内容不构成任何投资建议。据此做出的任何投资决策与国海证券国海证券员工或者关联机构无关本次 会议。一直是转发国海证券已发布研究报告的部分观点,仅反映国海证券研究人员于发布完整报告当日的判断相关内容,请以研究,所以公开发布报告为准会议,严禁录音或转发任何人不得对本次会议的任何内容进行发布复制。编辑改编转载播放展示或以其他任何方式非法使用本次会议的部分或者全部内容,否则将承担相应的法律责任。 国海证券就此保留一切法律权利。在任何情况下,国海证券及其员工对使用本次会议信息或内容所引发的任何直接或间接损失。外部负责市场有风险,投资需谨慎。各位线上的领导大家好,欢迎参加国海传媒ai培训框架系列电话会今天开始我们用三次电话会每次30分钟把世界模型这个当下比较热的方向给系统性的讲透三讲的安排是第一讲讲现状站在2026这个时点,世界模型到底发展到了哪一步? 第二讲讲来路,它是从哪些技术脉路一路演进过来的第三,讲讲归途与评价,各条路线会往哪里去,以及作为投资者,我们应该拿什么去衡量一家世界模型公司。为什么要讲这三讲,因为我们发现世界模型这个词儿现在被用用的有点泛了,有的视频模型叫世界模型,有的3d生成模型,也叫世界模型,机器人公司和自动驾驶的公司都在讲,所以我们的出发点不是做技术科普也不是罗列模型,而是帮大家建立一套能落到产业研究和投资判断。 段上的分析框架今天第一讲,我们先把现状给讲清楚。第一讲,我们将围绕这四个问题展开,大家可以对照目录页来进行查看。其实这四个问题就是在回答为什么是什么,到哪里了,谁在做后面的第二讲,第三讲都会在这个框架上继续往下展开好,我们将直接进入第一部分,我们首先看资本层面的信号,左右两边分别是海外和中国的代表性融资。事件过去18个月。 物理ai领域的融资总规模已经超过了100亿美元,海外头部项目单笔融资达到了10亿美元的量级。媒体报道估值约50亿美元,国内头部项目单比达到了数10亿人民币的量级,估值超过百亿元,资金的投向也很有意思,不只有模型。除此之外,还有机器人本体数据引擎3d世界模型等同时都被压住,再看中间的时间轴,从2024年的sara和vja到2025年的jinny3 marble再到2025和2026之交的dream zero和dreamed,以及2026年的v japa two。 标志性的模型迭代节奏明显加快,并且路线从纯视频生成扩展到了影空间,生成3d空间以及wam资本和模型两条线叠加在一起,说明市场对世界模型的产业链预期正在系统性的升温。这就是我们今天讨论它的第一个背景。同时模型数据算力这三个条件第一次达到了相对可用的阶段,先看模型册2024年sora验证了一件很重要的事情,把transformer扩散模型和大规模视频数据结合起来,模型可以学会一定的空间关系物体持续性和运动规律。 它虽然离完美的world。还很遥远,但是证明了视频本身可以成为学习世界的重要载体,为后面整个视频路线提供了可拓展的预训练范式。第二是数据测过去世界模型最大的短板是动作数据太少。互联网上有海量的图片和视频,但画面为什么变是谁做的动作往往没有标签? 具身智能的爆发倒逼行业建立起了一套全新的数据供给体系,真机遥操无本体数据,互联网第一人称视频,使得世世界模型第一次拥有了可规模化拓展的训练语料。第三是算力侧世界模型,要求持续推演世界的变化,机器人和自动驾驶还有低延迟甚至端侧实时控制,伴随着云端训练集群和端测ai芯片的持续迭代云端大脑加端侧小脑的协同架构,开始具备工程可行性这3个条件的凑齐。世界模型的训练才开始真正进入加速阶段。 条件具备只是必要条件方向方向上,还需要有共识这一页,我们放了三位关键人物的观点,他们的技术路线完全不同,但结论却惊人的一致,杨立坤认为llm只是在模拟语言统计的相关性。最多做出一个会说话的模型,并且仅靠语言建模,很难实现对物理世界的充分理解。模型需要学会抽象的世界状态,并且在内部去预测未来。强化学习之父,图灵奖获得者richard sutton强调的则是另外一个方面,真正的智能不不是坐在那里,把知识背下来,而是在环境。 中采取行动,并且根据后果来不断的修正自己ai项目,李菲菲则提出了一个分类框架,他以强化学习经典理论pomd。Po,m,d,p为基础,把现有技术划分为渲染器模拟器规划器三个大类,1个负责把世界画出来,1个负责推演动作的后果,1个负责在世界中做出规划。这个框架我们将会在后面反复用到。大家争论了很多年,但其实最后都是在回答一个问题。 Ai,下一步要进入物理世界,必须要补上什么?答案高度一致,光靠会说还不够,还需要会感知世界,理解变化,预测后果,并且与环境发生交互。我们都知道大语言模型很强,它可以回答我们的问题,帮忙写代码,甚至把很多物理现象都解释的头头是道,但它最终核心训练的目标始终就都是一个就是next tokenprediction。给定前文去预测下一个词源,这里就有一个非常值得琢磨的问题llm能流利的解释玻璃杯掉在地上会碎,是因为他学会了人类如何去描述重力。 它的建模是符号世界,并不意味着它真的在内部建立了材料属性重力碰撞和空间状态,而世界模型做的是另一件事,对杯子施加1个力,它接下来的位置速度姿态会怎么变?一辆车开进了路口,他选择加速减速或者左转,后面的交通状况会发生变化。总结来说,llmm到世界模型是从描述世界走向预测世界如何演进,从next token prediction走向next state prediction。 现在我们进入第二部分世界模型到底是什么?我先给大家一个直观的比喻。世界模型是ai的想象模拟器,大家想一下人是怎么做决策的,看到桌边放着一个杯子,我们不用真的推一下就知道往外推,它会掉下去,如果看到前面的车突然减速,我们的脑子里会预判如果我们继续加速会怎么样?也就是说,人在行动之前会在内部来进行模拟未来,而世界模型给ai要补上的就是这个能力。 拆开来看就是三件事情第一,理解并形成当前事件的状态。第二,假定某个动作发生的情况下,把世界向未来推演。第三,把推演的结果交给人或agent去用。它可以是一段能人能够看到的视频,一个可以探索的3d空间,也可以是模型内部一种看不见的。 影状态就是不再不把算力花在画面上只保留决策所需要用到的信息。我们可以在基础模型的体系中看得很清楚。Llm和vlm处理的是语言语义和视觉内容,而wmvlawam则面向的是物理世界的真实交互,方便大家理解,我们把世界模型压缩成一个公式,大家可以看这张图。当前状态s加上动作action,经过预测器predictor,就可以得到未来的状态se片。 如果模型在预测未来状态的同时,还可以输出下一步的动作,那它就升级成了wam,也就是world action model。这个公式的价值在于市面上所有路线的分歧都可以还原成对这三个问题的不同。回答问题一state是什么,即世界用什么来表示是像素和视频?3d几何还是抽象的引空间? 问题二action怎么表达是机器人的位置键盘指令还是一句?自然语言问题三predictor是服务什么功能?要把世界画出来推演动作后果还是直接参与动作规划?以后大家再看到各种类型的word model,不要被名字所迷惑,可以先问这三个问题它的state是什么? Action是什么?Predictor为谁服务基本就可以把它放回到我们这个框架里面?State的选择不只是技术细节,还直接决定了三件事情模型能利用什么数据算力烧在哪里最适合什么商业场景。这一张表列出了从token到state的四种选择。 视频路线更互联网规模的数据红利3gd路线更强调空间结构,引空间路线,更看重预测和决策的效率。这表面上是模型的形态之争,底层其实是是一场比拼压缩鼻和效率的争斗。你认为世界可以被压缩成什么就会选择什么样的state?进而决定了数据来源算力头像和商业化路径。 沿着state的维度,我们把主流流派分成了三派,第一派是2d视频派代表是openai的sora。谷歌的jony3最大的优势是数据,由于互联网有海量的数据,并且视频天然带有时间的变化,就很适合靠scaling去学习世界的变化规律。代价是训练推理都很贵,而且画面真实并不等于物理正确。第2派是3d空间派,代表是world leaves the marble循和科技和腾讯混元。 他们的出发点是ai,最终要在真实的空间里行动,只靠生成2d的画面可能不够模型,需要知道物体在哪里距离有多少不同的视角。优势是这样的空间结构可以导航,可以编辑,但是缺陷是高质量的结构化,3d数据目前还比较稀缺。重建和渲染本身也具有较高的成本,第三派是影空间派,代表是meta的v two deep mind的dreamer。他们的逻辑更像人类的认知。 我们在做决策的时候并不会重建视野里的每一个像素。真正关心的是比如杯子的形状位置可以抓取的区域和我们之间接触的关系,而并不会注意到每一个桌面木纹的细节。所以说,这一派把世界压缩到抽象的lentspace里。主打预测和规划效率如果我们看predictor,最后来干什么,就可以按照李菲菲的分类把世界模型分为渲染模拟规划三类,第一类是渲染器解决把世界画出来的