您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 国泰海通计算机:世界模型与VLA上车智驾技术路线进入端到端2.0 - 未知机构 | 发现报告

国泰海通计算机:世界模型与VLA上车智驾技术路线进入端到端2.0

2026-08-24 未知机构 丁叮叮叮
报告封面

一、AI总结内容 一、核心要点 1. 自动驾驶技术正从模块化算法向端到端转型,端到端1.0可突破人工驾驶规则限制,但对复杂场景的因果推理与长尾分布问题处理不足,需升级为端到端2.0,核心是构建对物理世界的预测与推理能力,引入世界模型与VLA(视觉语言动作模型)。 2. 2026年各头部厂商推进技术迭代:特斯拉推出FSD V14.3强化复杂场景处理,将新车模型蒸馏至老一代硬件;英伟达发布340亿参数的UberMODEL,形成云端大模型至车端小模型的闭环架构;Vivo推出基于谷歌DeepMind DN3的世界模型,采用多模态方案;小鹏、华为、Momota等国内厂商也有端到端2.0相关布局。 二、关键技术壁垒 1. 数据结构:端到端2.0时代,数据来源分为量产数据、Robotaxi数据、Model扩增数据、闭环强化学习数据四层,核心指标为问题识别、重构、扩增、训练验证及部署速度。 2. 世界模型质量:需满足物理一致性、长时间稳定性、多传感器一致性、动作可控性及闭环响应等要求。 3. 实时推理能力:需通过模型压缩、蒸馏等手段满足车规延迟要求,是VLA短期核心瓶颈。 4. 强化学习闭环:需从模仿学习升级至超越人类平均水平,借助虚拟环境完成策略优化。三、投资线索与关注方向 1. 关注海外厂商(英伟达、Vivo、Waymo等)世界模型、VLA的L4安全验证基础设施落地情况。 2. 关注特斯拉利用真实世界数据与强化学习跨越长尾场景、打通基础模型的进展。 3. 关注国内厂商(小鹏、华为、Momota等)将相关技术转化为大规模量产体验的效率。四、风险提示 1. 自动驾驶技术迭代不及预期,世界模型与VLA上车量产进度滞后。2. 数据积累与处理能力不足,难以支撑端到端2.0的发展。3. 技术路线竞争加剧,行业资源分散影响整体推进速度。 二、音频原文(转写) 大家好,欢迎参加国泰海通计算机世界模型,与vie上车制驾技术路线进入端到端2.0,目前所有参会者均处于静音状态下面开始播报声明本次电话会议仅服务于国泰海通证券正式签约客户会议音频及文字记录的内容。仅供国泰海通证券客户内部学习使用不得外发,并且必须经国泰海通证券研究所审核后方可留存国泰海通证券未授权任何媒体转发。此次电话会议相关内容未经允许和授权转载转发均属侵权国泰海通证券将保留追究其法律责任的权利。 国泰海通证券不承担因转载转发引起的任何损失及责任市场有风险投资需谨慎提醒广大投资者谨慎做出投资决策。嗯,各位领导各位投资者晚上好,我是国达海通计算机刘天雅,欢迎参加国达海通计算机ai开花科技自立深度研究系列电话会,呃,今天交流的主题是世界模型与vla上车呃。其实我们呃理解这个自动驾驶技术,它正在进入新1轮的一个发射。是切换,然后过去几年来看的话,其实行业最重要的变化是从模块化算法向 端到端转型,从这个感知啊,预测规划控制之间,原本是由这个工程师设计的,就是有大量接口和规则。 开始被统一的一个神经网络所取代,然后汽车现在逐渐是从这个按驾驶员写好的规则。呃驾驶转向从真实数据中学习如何驾驶,那就整体来看的话,其实我们今天主要呃讨论的有三个重点吧,然后第一是为什么就是呃,为什么一段是端到端之后仍然是需要世界模型和vla第二是像呃testra,然后包括英伟达vimo以及国内呃头部厂商目前分别走到了哪一步。然后第三是呃,这个当前厂商开始讲这个端到端世界模型和包括这个物理a. I菲斯普雷亚以后真正拉开差距的壁垒究竟是什么? 呃首先这个过去来看的话,其实传统自动驾驶本质上是一套就是比较高度工程化的流水线。呃像这个摄像头激光雷达,还有等等一些传感器,首先是进行感知,然后识别车辆行人还有道路结构,然后这个预测模块判断其他呃交通参与者下一步可能做什么,然后规划模块,选择这个车辆轨迹,然后到最后控制模块去执行方向盘制动,还有油门的一些动作。这套系统的优势是有这个工程方面是有比较清晰的,这个边界,但有一个就主要是一个问题发生。 之后可以去追溯呃,究竟是感知层面是错了还是预测层面错了还是规划错了。但是随着自动驾驶进入复杂城市环境,其实有一个呃越来越明显的问题是现实世界中的这个驾驶规则几乎是不可能被人工囚禁的。所以呃,这个端到端1.0,实际上就是为了突破这一层限制,它把原本分离多个模块,逐渐放到统一的神经网络当中。让模型直接学习输入什么样的道路信息对应什么样的驾驶行为? 然后呃这里面就是摩曼塔的技术迭代,其实就是一个比较典型的案例吧,就包括我们之前也有跟专家交流,就是它的这个r6呃模型仍然是分段式端到端,然后是同时保留大量。规则代码底呃托底的,但是这个儿期就开始进入到真正的一段式端到端,然后规则代码也是明显减少的,包括这个系统延迟也是由140毫秒下降到110毫秒左右,包括像tesla,则是更早推动类似的方向它的基。束眼镜呃,我们主要概括为就是像这个bev加上这个transformer,还有occupancy再到这个多模态的端到端的一个闭环的一个模式。 但是也可以理解为就是呃,一段是端到端,并不意味着就是增加时已经完全解决它。最核心的问题是就是比如说像这种呃比就是完全这个行为,克隆的话,它是能够教呃汽车模仿老司机,但是却不等同于于就是汽车,真正理解司机是为什么是这样开的,就是举一个比较简单的例子来说,就是如果一个皮球去突然滚到马路中央,嗯,人类司机是即使是没暂时没有看到有小孩子,但也可能提前减速,因为人类是会进行因果推理的。 呃,所以这个酒,它可能意味着周围是有儿童的,然后儿童是可能紧随其后去进入道路的,所以这不简单的是,就是检测到某个物体以后去执行刹车,而是对应像这个场景语义物体运动的一个规律,还有以及这个未来的风险去进合一个进。进行一个联合的一个判断啊。所以这些场景呢,就是呃,恰恰是就是端到端1.0的一些难点吧,就是真实的驾驶数据,它是具有非常明显的一个长尾分布的,然后普通的呃直行啊,跟车呀,还有红绿灯的这些场景,每天是出现无数次的,但真正高风险的这些corner case,它是极其罕见的那模型,如果只是呃,根据历史轨迹学习驾驶呢,就很容易在就是训练分布内是表现的很好的,但是遇到此前没有出现过的环境的时候,他的能力就是迅速的会快速下降的。 那2026年也就是今年4月份呢,这个特斯拉也推出了自己的fsd呃v14.3,然后去进一步加强了强化学习训练,也是重点提升对这个少见复杂场景的1些处理能力。就比如说有一些突发的情况突发的卡地呢。 还有一些像复杂路口啊,还有一些常委的一些情况去同时去收集它的这个视觉网络,并且重新优化,像ai编译器啊,还有它所运行的这个环境。然后使这个整体,它的结果是使车端呃推理延迟最高降低20%就简单来说的话,就是让这个fsd在复杂环境下就判断的更准,同时反应速度更快,然后还有到了这个二季度,然后特斯拉它又开始把原本主要运行。 现在就是自己的这个ai4呃新硬件上就是v14能力去进一步压缩到老一代的就是硬件上面就你自己也推出了类似像v13呃let这种版本就可以理解为就是呃,让这个算力更强的新车跑完。呃完整的一个版本,然后再通过模型蒸馏把核心能力迁移到老车上。呃,因此就是特斯拉,它自己还持续的去扩充像呃,这个云端ai呃云端ai训练的一些算力,然后为后续更大的一个模型和更快的一个迭代去提供一些支持。 这件事情就是整体来看,就是特斯拉的一些进展也是非常值得关注的,因为它揭示了就是下一个阶段,这个端到端的两个核心矛盾。呃,一方面是呃,一方面就是模型必须是越来越大的,包括它的这个推理能力啊,recent啊是需要越来越强的。呃,另一方面真正上车的时候,这个推理延迟和新建资源又非常的有限。呃,所以整体来看的话端到端2.0,它不仅是模型能力的升级,它也是整体的。 像呃,这个蒸馏啊,还有实施推理能力的整体的一个竞争。呃,从这个角度看,来来看的话,其实端到端1.0和2.0也是可以做一个区分的就1.0,可以更多解决如何把几十万个规则变成一个神经网络。然后2.0呢是进一步去解决如何在这个神经网络内部去形成对物理世界的预测和推理能力。它不是把端到端去推倒重来,而是在这个内部去增加1个更强的世界理解层。 这也是为什么说就是今年就是word model和包括这个vla呃,也同时成为这个支架领域呃非常重要的一个技术关键词那呃,接下来我们其实核心重点还是看这个头部玩家的一些呃技术路线呃,首先就是我们可以先看一下这个英伟达,因为从这个当前最新的路线来看的话,其实英伟达可能是把就是包括自己的这个这个vla啊word model啊还有呃强化学习啊,还有车端算力这几件事情去组合的比较完整的一家一个一家公司,像今年8月4号的话英伟达,它也正式开放了自己这个呃super,然后相比于上一代这个参数,它规模约呃上一代就是它的这个apple玛雅大概是100亿的参数。 然后新的这个模型升级到了340亿参数,它主要是由320亿参数的这个cos3 super reason,然后再加上20亿参数的diffusion action expert去组成。然后并且是采用了这个强化学习完成训练后的调优,然后模型是可以同时处理最多切入摄像头形成的360度视觉输入,并且在疑似呃这个基础模型中输出未来的这个车辆轨迹。因果推理链包括像场景问答,还有自动推理等等一些内容啊。 这个架构为什么是值得关注的呢?因为过去这个自动驾驶,它通常是需要多个比较独立的模型,就比如说,1个负责环境感知1个负责路径规划1个负责数据标注,还有1个可能是负责像这种专门做评估,而这个奥巴马有to2 super,他的这个目。目标是把这些能力全部呃整合进一个基础大模型里面呃就是他同一个模型,既能去作为这个大呃教师的大大模型教师呃用来去训练体积更小的车端模型,然后他也能去承担数据筛选和自动标志住的这些任务也可以变扮演这个呃评判者的角色判断。 那其他驾驶模型的决策是否是合理的?包括呃就是英伟达,这边也进一步明确呃大模型是可以在车端进行前沿的一些呃规模推理的。再通过一些像知识蒸馏啊,把能力压缩成更小更专精的一些模型去部署到他的这个dr ive呃driveagx车载计算平台上面。然后这个实际上就勾勒出了一套非常清晰的,就是从这个云端大模型到车端小模型的一个技术架构,呃,未来车上的vla模型,它未必是需要直接运行几十亿甚至上百亿参数的一个完整推理模型,它更现实的一个路径是由这个云端大模型负责。 生成高质量的推理轨迹标签和策略,再通过蒸馏把核心能力迁移到能够实时运行的车端模型当中,所以对英伟达来说,真正值得关注的其实不是upper呃这一个模型,而是而是它已经形成了一个就是比较完整的呃。技术闭环吧,然后从这个uppermoil啊负责推理型的这个vla模型,然后它有这个cost screens去负责生成式视觉模型,然后再到这个upperg去呃提供高吞吐量的一个闭环的强化学习环境。 而且英伟达对这个alpa jim的定位也是非常明确的,就是传统的就是像这种open look就开环训练只是让模型在历史数据上做一次动作的预测,而闭环强化学习会让每一次刹车转向,还有呃导航决策。去真正改变下意时刻所感知到的一些环境,就使模型能够从自身决策带来的实际后果中去学习。因此,其实英伟达现在也是在搭建这样一条比较完整的呃数据路径吧,就是从这个真实世界数据开始到世界模型再到推理型的一个vla模型再到闭环强化学习,然后再到一定的知识蒸馏,然后再到最后的这个车载部署,这也就是形成了,就是所谓的这种端到端自动驾驶2.0的一个完整的一个形态啊。 呃,所以我们整体的一个判断就是英伟达。这个最新的技术已经不再局限于过去的这个支架芯片,加上酷大的1个计算平台,它的角色正在向呃物理人工智能操作平台去转变上层提供基础大模型,中层提供世界模型和强化学习环境,然后下层通过它的这个去提供车端的呃车端,这些推理算力啊这种大模型加仿真加训练加芯片的1个完整体系,很可能是成为这个未来第三方车企迈入呃,就是第三方企业吧,然后迈入呃端到端自动驾驶2.0时代的一一条关键的一个路径啊。 然后其次是呃,必须要