您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度19期:多模态如何从模型拼接走向统一? - 发现报告

汽车行业深度报告:AI系列深度19期:多模态如何从模型拼接走向统一?

交运设备 2026-08-07 黄细里 东吴证券 七个橙子一朵发🍊
报告封面

AI系列深度19期:多模态如何从模型拼接走向统一? 2026年08月07日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼多模态智能的本质,是把文本、图像、音频、视频等映射进统一表示,并在此基础上完成理解、推理、生成与交互。我们认为,多模态是AI2.0“架构、任务、模态三重收敛”在模态维度的集中兑现。 ◼我们依据“模态对齐发生在流程的哪个阶段”,将多模态的发展过程划分三阶段:2021—2023年为外挂式/组合式阶段,CLIP、Flamingo、BLIP-2、LLaVA等通过视觉编码器、投影层、Q-Former或指令微调把图像接入语言模型;2023—2024年进入原生多模态阶段,Gemini代表多模态能力从接口层前移到预训练阶段;2024年至今进入全模态Omni阶段,GPT-4o将文本、视觉和音频输入输出纳入同一实时交互闭环。 ◼沿三阶段看,主线是对齐位置不断前移、转换损耗逐级下降。外挂式阶段工程效率高,但图像先被视觉编码器压缩再送入语言模型,细节、空间关系和时序信息存在损耗;原生阶段让文本、图像、音频、视频从训练早期共同参与表示学习,提升复杂真实任务中的泛化能力,同时显著抬高数据、训练系统和跨模态对齐门槛;Omni阶段进一步将多模态从“统一预训练”推进到“实时统一交互”,补齐听、看、说的互动性。 相关研究 《AI系列深度17期:视觉智能为何引入Transformer?》2026-08-06 《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-06 ◼我们认为,Omni并非多模态发展的终点,理解与生成统一、多模态深度推理有望成为下一阶段两条核心主线。其一,理解偏重高层语义,生成需保留空间结构与纹理细节,二者存在表征冲突,业界正沿纯自回归、扩散及二者融合等范式,探索共享编码或“编码解耦、主干统一”。其二,以o1为代表的深度推理已由语言扩展至图像、视频和具身场景,但当前仍以语言思维链为主;视觉工具增强、视觉—语言交错推理、多模态潜空间推理等方向正在加速发展,以视觉表示或多模态潜变量为原生载体的推理仍处于早期阶段。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代不及预期的风险,大模型厂商ARR增速放缓的风险,云服务商资本开支不及预期的风险,智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.多模态的核心问题:统一表示下的理解、推理与交互............................................................41.2.多模态是“统一基础模型”在模态维度的兑现.............................................................................4 2.1.三阶段框架:对齐位置前移、转换损耗下降............................................................................52.2.阶段一·外挂式/组合式:先把图像“接进”语言模型..................................................................52.3.阶段二·原生多模态:把对齐前移到预训练...............................................................................72.4.阶段三·全模态Omni:把统一处理前移到实时交互.................................................................8 3.1.全模态Omni路线的瓶颈...........................................................................................................103.2.方向一:理解与生成的统一——三条技术路线......................................................................113.3.方向二:多模态推理——从语言o1到多模态深度思考........................................................12 4.结论:多模态收敛于同一个Transformer,深度推理仍是关键变量.............................................13 图表目录 图1:多模态大模型发展三阶段:对齐位置前移、转换损耗下降......................................................5图2:外挂式/组合式多模态的典型结构.................................................................................................7图3:全模态Omni路线与传统串联式流程对比.................................................................................10图4:理解与生成统一的三条技术路线................................................................................................12 表1:多模态大模型发展三阶段框架......................................................................................................5表2:阶段一·外挂式多模态代表论文.....................................................................................................6表3:外挂式多模态与原生多模态对比..................................................................................................8表4:传统串联式语音助手与全模态Omni路线对比...........................................................................9表5:理解与生成统一的代表性探索....................................................................................................11 1.复盘多模态:基础模型如何统一语言、视觉与生成 1.1.多模态的核心问题:统一表示下的理解、推理与交互 多模态大模型关注的核心问题,是模型如何统一处理文本、图像、音频、视频等不同模态,并在统一表示之上完成理解、推理与交互。这个界定包含两层含义:其一是“统一”,即不同模态需要被映射到同一套可供模型处理的表示中,而不是各自为政;其二是“理解、推理、交互”,即统一表示不只是为了识别或匹配,更要支撑跨模态语义理解、组合推理和实时交互。 人类智能天然是多模态的。人在认识世界时,视觉、听觉、语言、动作彼此交织、相互印证:语言中的“红色”、视觉中的红色光谱、动作中对红色信号灯的反应,指向的是同一个概念。机器智能若要逼近通用,同样需要跨越单一模态边界。多模态正是需要把这些分散能力统一到一起。 因此,理解多模态不能只看“模型能接收几种输入”。能接收图像输入的语言模型早已存在,但模态之间是松散拼接还是深度统一、对齐发生在流程的哪个位置、信息在跨模态转换中损失多少,才是区分不同技术路线的关键。 1.2.多模态是“统一基础模型”在模态维度的兑现 在AI1.0时代,处理不同模态需要不同专用架构:图像用卷积网络,语音用隐马尔可夫模型或循环网络,文本用循环网络。模态之间几乎不共享表示,跨模态任务要靠人工设计流程,把多个专用系统串起来。Transformer出现后,“把任意模态切成token、喂进同一个注意力骨干”成为可能,这正是架构收敛与模态收敛能够同时发生的技术前提。 因此,多模态的发展史,可以视作“模态对齐由人工设计逐步升级为模型自行统一”的历史。外挂式阶段,对齐靠人工设计的连接模块完成;原生阶段,对齐前移到预训练,由统一模型在多模态数据上联合学习;Omni阶段,对齐进一步前移到单一模型实时处理,所有模态进入同一个神经网络。 数据来源:东吴证券研究所 2.多模态发展阶段:对齐前移与转换损耗下降 2.1.三阶段框架:对齐位置前移、转换损耗下降 我们对2021年以来多模态大模型代表性学术成果进行了梳理,按“模态对齐发生在流程的哪个位置”将其归纳为三个阶段。需要说明的是,三个阶段在时间上有所重叠,且后一阶段并不意味着前一阶段方法被淘汰。例如外挂式结构至今仍是大量视觉语言应用的主流实现,三阶段刻画的是技术前沿的重心迁移,而非简单的新旧替换。 我们认为,原生多模态阶段始于2023年,可视为多模态大模型的元年。这一年起,多模态从“语言模型的外接功能”,开始转变为“基础模型的内生能力”。此时多模态才第一次成为头部基础模型从预训练阶段就共同面向的目标,而非事后接入的扩展。 2.2.阶段一·外挂式/组合式:先把图像“接进”语言模型 2021—2023年,多模态模型处于外挂式/组合式阶段,核心问题是如何让图像进入语言模型体系。主流方法是先训练好视觉模型、语言模型或图文对齐模型,再通过连接模块把它们拼接起来。该阶段的根本局限在于:多模态能力主要是“接上去”的,而不是模型从一开始就具备的。 CLIP是这一阶段的起点。它的核心贡献不是生成图像,而是用大规模图文对进行对比学习,把图像和文本映射到同一个语义空间。CLIP使用约4亿组图文对训练,证明自然语言可以作为视觉概念的开放式标签,使模型具备零样本迁移能力。换言之,CLIP解决的是“视觉世界如何接入语言语义空间”的问题,其图文对齐思想对Flamingo、BLIP-2、LLaVA乃至Stable Diffusion等大量后续模型有深远影响。其局限在于复杂推理、多轮对话和细粒度视觉解释能力不足。 Flamingo解决的是视觉信息如何接入大语言模型,并让模型基于图像进行生成式回答的问题。它用预训练视觉模型与语言模型进行桥接,使模型能够处理任意交错的图像、视频和文本序列,并通过少样本提示适应视觉问答、图像描述等任务。其技术意义在于,多模态模型开始从“图文相似度匹配”,进入“视觉条件下的语言生成”。Flamingo确立了外挂式多模态的基本形态:冻结或复用强大的单模态模型,再通过桥接模块组合成多模态模型。 BLIP-2解决的是降低视觉编码器与大语言模型连接成本的问题。论文认为,大规模端到端训练视觉语言模型成本过高,因此冻结已有图像编码器和大语言模型,只训练一个轻量级Q-Former来桥接视觉与语言,从而大幅降低视觉语言预训练门槛,成为后续大量开源多模态模型的基础结构。 LLaVA将指令微调引入多模态模型,用GPT-4生成多模态指令跟随数据,并把视 觉编码器