发布时间:2026-08-24 一、AI总结内容 一、核心要点 1. 自动驾驶技术正从端到端1.0向2.0迭代,1.0是将人工规则转为统一神经网络,实现从规则驾驶到数据学习驾驶;2.0是在神经网络内部形成物理世界预测推理能力,核心是世界模型与VLA(视觉语言动作模型)。 2. 端到端1.0的核心短板是长尾复杂场景处理能力不足,仅靠模仿学习难以应对未出现过的路况,2026年特斯拉FSD V14.3通过强化学习优化该类场景处理,还推动模型在新旧代车间迁移。 二、各厂商技术进展 1. 英伟达:推出340亿参数的Super模型,整合环境感知、规划等多任务能力,形成云端大模型到车端小模型的闭环架构,定位转向物理人工智能操作平台,为车企提供端到端2.0路径。 2. 特斯拉:将FSD V14明确为端到端基础模型,推进强化学习训练、模型精流与硬件协同,依靠超148万付费订阅用户数据优势,补齐2.0所需核心能力,但未明确采用VLA或世界模型架构标签。 3. 维莫:推出基于谷歌DeepMind的Vimo世界模型,擅长生成复杂长尾场景,在量产层面坚持多模态感知与安全冗余设计,将大模型融入既有智驾体系而非完全替代安全架构。 4. 海外公司VIVI:提出自动驾驶2.0概念,以具身人工智能与端到端基础模型实现能力泛化,推出Gai4将AI驾驶员嵌入世界模型闭环,推动仿真从复现过去转向生成未来。 5. 国内厂商:小鹏将VLA与预测视觉模型深度融合,推出X Mind模型压缩未来视觉信息;华为采用云端世界引擎+行为模型路线,ADS已达128亿公里里程;摩卡R7世界模型进入量产,覆盖乘用车、无人矿卡等场景。 三、核心壁垒与未来方向 1. 四大壁垒:一是四层结构的数据能力(真实量产数据、高价值长尾数据、世界模型扩增数据、闭环强化学习数据);二是世界模型的物理一致性等质量;三是VLA推理的车端实时性;四是强化学习的闭环能力。 2. 2026年成为自动驾驶技术范式转折点,未来竞争是体系之争,需形成从数据到决策再到实时部署、安全验证、真实反馈的完整物理AI闭环,关注海外玩家仿真是否成L4安全验证基础设施、特斯拉数据优势能否突破长尾、国内厂商技术量产转化。 二、音频原文(转写) Remain on the line大家好,欢迎参加国泰海通计算机世界模型,与vie上车制架技术路线进入端到端2.0,目前所有参会者均处于静音状态下面开始播报声明本次电话会议仅服务于国泰海通证券正式签约客户会议音频及文字记录的内容。仅供国泰海通证券客户内部学习使用不得外发,并且必须经国泰海通证券研究所审核后方可留存国泰海通证券未授权任何媒体转发。此次电话会议相关内容未经允许和授权转载转发均属侵权国泰海通证券将保留追究其法律责任的权利。 国泰海通通证券不承担因转载转发引起的任何损失及责任市场有风险投资需谨慎提醒广大投资者谨慎做出投资决策。嗯,各位领导各位投资者晚上好,我是国达海通计算机刘天雅,欢迎参加国达海通计算机ai开花科技 自立深度研究系列电话会,呃,今天交流的主题是世界模型与vla上车呃。其实我们呃理解这个自动驾驶技术,它正在进入新1轮的一个发是切换,然后过去几年来看的话,其实行业最重要的变化是从模块化算法向端到端转型,从这个感知啊,预测规划控制之间,原本是由这个工程师设计的,就是有大量接口和规则。 开始被统一的一个神经网络所取代,然后汽车现在逐渐是从这个按驾驶员写好的规则。呃驾驶转向从真实数据中学习如何驾驶,那就整体来看的话,其实我们今天主要呃讨论的有三个重点吧,然后第一是为什么就是呃,为什么一段是端到端之后仍然是需要世界模型和vla,第二是像呃tesla,然后包括英伟达vimo以及国内呃头部厂商目前分别走到了哪一步。然后第三是呃,这个当前厂商开始讲这个端到端世界模型和包括这个物理。 A.I非出口ai以后真正拉开差距的壁垒究竟是什么?呃首先这个过去来看的话,其实传统自动驾驶本质上是一套就是比较高度工程化的流水线。呃像这个摄像头激光雷达,还有等等一些传感器,首先是进行感知,然后识别车辆行人还有道路结构然后这个预测模块判断其他呃交通参与者下一步可能做什么,然后规划模块,选择这个车辆轨迹,然后到最后控制模块去执行方向盘制动,还有油门的一些动作。 这套系统的优势是有这个工程方面是有比较。清晰的这个边界,但有一个就主要是一个问题,发生后可以去追溯呃,究竟是感知层面是错了还是预测层面错了还是规划错了,但是随着自动驾驶进入复杂城市环境,其实有一个呃越来越明显的问题是现实世界中的这个驾驶规则几乎是不可能被人工囚禁的,所以呃这个端到端1.0实际上就是为了突破这一层限制,它把原本分离多个模块,逐渐放到统一的神经网络当中。 让模型直接学习输入什么样的道路信息对应什么样的驾驶行为?然后呃这里面就是罗曼塔的基础迭代,其实就是一个比较典型的案例吧,就包括我们之前也有跟专家交流,就是它的这个r6呃模型仍然是分段式端到端,然后是同时保留大量。规则代码底呃托底的,但是这个rc就开始进入到真正的一段式端到端,然后规则代码也是明显减少的,包括这个系统延迟也是由140毫秒下降到110毫秒左右,包括像tesla,则是更早推动类似的方向它的技术。 眼镜呃,我们主要概括为就是像这个bev加上这个transformer,还有occupancy再到这个多模态的端到端的一个闭环的一个模式。但是也可以理解为就是呃,一段式端到端并不意味着就是自动驾驶已经完全解决它。最核心的问题是就是比如说像这种呃behavior corny就是完全这个行为,克隆的话,它是能够教呃汽车模仿老司机,但是却不等同于于就是汽车,真正理解司机是为什么是这样开的,就是举一个比较简单的例子来说,就是如果一个皮球去突然滚到马路中央,呃,人类司机是即使是没暂时没有看到有小孩子,但也可能提前减速,因为人类是会进行因果推理的。 呃,所以这个球它可能意味着周围是有儿童的,然后儿童是可能紧随其后去进入道路的,所以这不简单的是,就是检测到某个物体以后去执行刹车,而是对应你像这个场景语义物体运动的一个规律,还有以及这个未来的风险去竞合一个进。进行一个联合的一个判断。所以这些场景呢,就是呃,恰恰是就是端到端1.0的一些难点吧,就是真实的驾驶数据,它是具有非常明显的一个长尾分布的,然后普通的呃直行啊,跟车呀,还有红绿灯的这些场景,每天是出现无数次的,但真正高风险的这些corner case,它是是极其罕见的,但模型如果只是呃,根据历史轨迹学习驾驶呢,就很容易在就是训练分布内是表现的,很好的,但是遇到此前没有出现过的环境的时候,他的能力就是迅速的会快速下降的。 那2026年也就是今年4月份呢,这个特斯拉也推出了自己的fsd呃v14.3,然后去进一步加强了强化学习训练,也是重点提升对这个少见复杂场景的1些处理能力。就比如说,有一些突发的情况,突发的卡地呢?还有一些像复杂路口啊,还有一些常委的一些情况去同时去收集它的这个视觉网络,并且重新优化,像ai编译器啊,还有它所运行的这个环境。然后使这个整体,它的结果是使车端呃推理延迟最高降低20%就简单来说的话,就是让这个ssd在复杂环境下就判断的更准,同时反应速度更快,然后还有到了这个二季度,然后特斯拉它又开始把原本主要运行。 停在就是自己的这个ai4呃新硬件上就是v14能力去进一步压缩到老一代的就是硬件,上面就自己也推出了类似像v13呃led,这种版本就可以理解为就是呃,让这个算力更强的新车跑完。呃完整的一个版本,然后再通过模型交流,把核心能力迁移到老车上。呃,因此就是特斯拉,它自己还持续的去扩充像呃,这个云端ai呃云端ai训练的一些算力,然后为后续更大的一个模型和更快的一个迭代去提供一些支持。 这件事情就是整体来看,就是特斯拉的一些进展也是非常值得关注的,因为它揭示了就是下一个阶段,这个端到端的两个核心矛盾。呃,一方面是呃,一方面就是模型必须是越来越大的,包括它的这个推理能力啊,rec啊是需要越来越强的。呃,另一方面真正上车的时候,这个推理延迟和芯片资源又非常的有限。呃,所以整体来看的话端到端2.0,它不仅是模型能力的升级,它也是整体的,像呃,这个蒸馏啊,还有实时推理能力的整体的一个竞争。 呃,从这个角度看,来来看的话,其实端到端1.0和2.0也是可以做一个区分的就1.0,可以更多解决如何把几十万个规则变成一个神经网络。然后2.0呢是进一步去解决如何在这个神经网络内部去形成对物理世界的预测和推理能力。它不是把端到端去推倒重来,而是在这个内部去增加1个更强的世界理解层。这也是为什么说就是今年就是word model和包括这个vla呃,也同时成为这个支架领域呃非常重要的一个基础关键词。 那呃,接下来我们其实核心动力还是看这个头部玩家的一些呃技术路线呃,首先就是我们可以先看一下这个英伟达,因为从这个当前最新的路线来看的话,其实英伟达可能是把就是包括自己的这个这个vla啊wordmodel啊还有呃强化学习啊simulation,还有车端算力这几件事情去组合的比较完整的一家一个一家公司,像今年8月4号的话英伟达,它也正式开放了自己这个呃super,然后相比于上一代这个参数,它规模约呃上一代就是它的这个apple大概是100亿的参数。 然后新的这个模型升级到了340亿参数,它主要是由320亿参数的这个cost3 superner,然后再加上20亿参数的diffusion action expert去组成。然后并且是采用了这个强化学习完成训练后的调优,然后模型是可以同时处理最多切入摄像头形成的360度视觉输入,并且在疑似呃这个基础模型中输出未来的这个车辆轨迹。因果推理链包括像场景问答,还有多推理等等一些内容。 这个架构为什么是值得关注的呢?因为过去这个自动驾驶,它通常是需要多个比较独立的模型,就比如说,1个负责环境感知1个负责路径规划1个负责数据标注,还有1个可能是负责像这种专门做评估,而这个奥巴马有出2 super,他的这个目。目标是把这些能力全部呃整合进一个基础大模型里面,呃就是他同一个模型,既能去作为这个呃教师的大大模型,教师呃用来去训练企业更小的车端模型,然后他也能去承担数据筛选和自动标志。 自助的这些任务也可以变扮演这个呃评判者的角色,判断其他驾驶模型的决策是否是合理的。包括呃就是英伟达,这边也进一步明确呃大模型是可以在车端进行前沿的一些呃规模推理的。再通过一些像知识蒸馏啊,把能力压缩成更小更专心的一些模型,去部署到它的这个drive呃drive a g x store车载计算平台上面,然后这个实际上就勾勒出了一套非常清晰的,就是从这个云端大模型到车端小模型的一个技术架构呃,未来车上的vra模型,它未必是需要直接运行几十亿甚至上百亿参数的一个完整推理模型,它更现实的一个路径是由这个云端大模型负责生成高质量的推理轨迹标签和策略,再通过蒸馏把核心能力迁移到能够实时运行的车端模型当中。 所以对英伟达来说,真正值得关注的其实不是upper呃这一个模型,而是而是它已经形成了。一个就是比较完整的呃技术闭环吧,然后从这个uppermoil呃负责推理型的这个vla模型。然后它有这个cost screens去负责生成式视觉模型,然后再到这个up去呃提供高吞吐量的一个闭环的强化学习环境。而且英伟达对这个alpa的定位也是非常明确的,就是传统的就是像这种open look就开环训练,只是让模型在历史数据上做一次动作的预测啊。 闭环强化学习会让每一次刹车转向,还有呃导航决策去真正改变下意时刻所感知到的一些环境,就使模型能够从自身决策带来的实际后果中去学习。因此,其实英伟达现在也是在搭建这样一条比较完整的呃数据路径吧,就是从这个真实世界数据开始到世界模型再到推理型的一个vla模型再到闭环强化学习,然后再到一定的知识蒸馏,然后再到最后,这个车载部署,这也就是形成了,就是所谓的这种端到端自动驾驶2.0的一个完整的一个形态。 呃,所以我们整体的一个判断就是英伟达。这个最新的技术已经不再局限于过去的这个支架芯