AI系列深度23期:智能驾驶的表征演进 2026年08月07日 增持(维持) 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn研究助理童明祺 执业证书:S0600125080005tongmq@dwzq.com.cn ◼物理AI与数字AI的根本差异,首先体现在表征获取方式上。文本天然离散且带语义,数字AI输入具备较强可token化基础;物理世界的输入则由连续光子、点云、运动和空间关系构成,缺乏天然通用的物理世界token化方案。因此,物理AI需要先构建三维物理空间的可学习表征,再进入规划、控制和行动。 ◼以智能驾驶为例,表征演进可概括为原始像素、BEV/VectorNet、Occupancy、多模态Token和潜在状态五个阶段。原始像素端到端简洁但缺少结构约束;BEV+Transformer与矢量化VectorNet是同一层级的两条并行路线,分别以特斯拉和Waymo为代表,前者把多摄像头信息统一到鸟瞰三维空间,后者把道路和参与者抽象成数学对象;Occupancy从识别对象类别转向判断空间占据;多模态Token连接视觉、语言和动作;潜在状态则把世界压缩到可预测空间。 ◼物理AI中的token化器本质上是重型编码网络。文本分词通常只是把离散符号映射为token,而车端BEV编码器、占用网络、VAE、3D编码器等承担了从连续物理输入到可学习表征的核心转换。离散化和嵌入不是预先给定的,而是由网络学习形成;这也是物理AI相较数字AI多出的一道关键工程门槛。 相关研究 《AI系列深度17期:视觉智能为何引入Transformer?》2026-08-06 ◼从公司证据看,特斯拉、小鹏、华为、理想、Waymo、Wayve等路线虽不同,但共同主线是从目标级识别走向空间级理解,再走向潜在状态预测。多种表征长期并存,并非简单替换:BEV与矢量、占用、3D高斯、世界模型潜空间,分别服务不同层次的感知、预测、仿真和规划需求。 《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-06 ◼世界模型可能成为表征训练的关键手段。标签稀缺使物理世界嵌入难以完全依赖人工监督,GAIA、Cosmos、JEPA系等世界模型通过自监督预测未来状态、生成场景或学习潜在动力学,帮助模型在无标注或弱标注条件下形成更统一的物理表征。竞争壁垒正从单点感知精度,前移到如何将物理世界嵌入可预测潜在空间。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险;大模型厂商ARR增速放缓的风险;云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.表征演进:物理世界如何进入模型......................................................................................................42.物理AI表征:缺乏天然通用token化方案........................................................................................42.1.文本侧:离散Token降低输入表征成本....................................................................................42.2.物理世界侧:连续信号需要先构建可学习底座........................................................................53.智能驾驶表征演进:从像素、BEV到潜在状态.................................................................................63.1.原始像素端到端:起点与局限....................................................................................................73.2. BEV加Transformer:从2D像素到3D向量空间......................................................................73.3. Occupancy占用:从“是什么”到“是否被占据”...........................................................................93.4.矢量化:从栅格图像到数学矢量..............................................................................................103.5.多模态Token:走向视觉—语言—动作统一...........................................................................113.6.潜在状态:从观测编码走向可预测空间..................................................................................124.世界模型:标签稀缺下的自监督表征训练工具................................................................................145.风险提示:............................................................................................................................................15 图表目录 图1:数字AI与物理AI输入处理链路对照..........................................................................................6图2:智能驾驶表征演进主线示意..........................................................................................................7图3:ViT在大规模预训练后的迁移分类表现.......................................................................................8图4:Occupancy Flow在D-FAUST上的4D点云补全表现.................................................................9图5:VectorNet相对栅格化基线的计算量与参数对比.......................................................................11图6:GAIA-1到GAIA-2:从离散Token加自回归到连续潜在加潜在扩散....................................13图7:物理AI的Token化器:BEV、占用、VAE与3D编码器等重型网络...................................13 表1:张量与嵌入Embedding基础概念.................................................................................................4表2:数字AI与物理AI表征问题对照..................................................................................................5表3:占用网络与占用流学术指标..........................................................................................................9表4:代表性中国大模型分词器与潜在表征要点................................................................................12表5:主要厂商车端感知表征路线........................................................................................................14表6:代表性驾驶世界模型对比............................................................................................................14表7:自监督潜在表征代表性工作........................................................................................................15 1.表征演进:物理世界如何进入模型 表征决定物理世界以何种形式进入模型。连续光子、点云、运动与空间关系需要先被转换为可学习的数值表示,模型才能进一步完成识别、预测、规划与控制。嵌入embedding是其中最常见的实现形式,通过将对象映射至连续向量空间,使语义、几何与关系信息由向量间的距离和方向承载;相似对象由此形成聚合,可区分属性沿不同方向展开,为下游判别、回归与规划提供统一输入。 张量是承载表征的统一数据形式。标量、向量、矩阵与更高阶数组统称张量,神经网络各层之间传递的数据本质上都是张量:文本经分词后查表映射为嵌入向量序列,形成序列长度×维度的张量;图像则天然对应高×宽×通道的像素张量。模型理解过程,可以视为不断将原始张量转换为信息更紧致、任务更可分的表征张量。 衡量表征质量,通常关注三点:1)是否保留任务相关信息,并使其尽量线性可分;2)是否压缩冗余与噪声;3)是否让相似对象在空间中聚合。上述标准将贯穿后续对各类物理AI表征的比较。下表先汇总相关基础概念。 2.物理AI表征:缺乏天然通用token化方案 数字AI与物理AI的根本差异,首先在于表征获取方式不同。文本天然是离散且带语义的符号序列,语言本身已由人类对世界完成一轮编码;物理世界输入则是连续的原始光子与点云,缺乏天然、通用、可直接处理的物理世界token化方案。这意味着物理AI迭代中多出一段数字AI无需经历的流程:先将三维物理空间构建为可学习底座。 2.1.文本侧:离散Token降低输入表征成本 在文本侧,将输入转为Token通常是轻量且可学习的步骤。文本经子词分词,如字节级BPE,切分为Token后查表得到嵌入;分词器训练成本低、词表规模可控,属于相对低成本的输入处理环节。 主流大模型的分词方案虽在算法与词表规模上存在差异