您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [东吴证券]:汽车行业深度报告:AI系列深度18期:生成智能如何引入Transformer? - 发现报告

汽车行业深度报告:AI系列深度18期:生成智能如何引入Transformer?

交运设备 2026-08-07 黄细里 东吴证券 Gnomeshgh文J
报告封面

AI系 列 深 度18期:生 成 智 能 如 何 引 入Transformer? 2026年08月07日 证券分析师黄细里执业证书:S0600520010001021-60199793huangxl@dwzq.com.cn 增持(维持) ◼生成式视觉的本质,是学习图像数据背后的分布规律,并在文本条件下生成新内容。本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间;扩散以更稳定的加噪—去噪学习确立生成主干,其潜空间建模与交叉注意力机制,也为Transformer的介入预留了接口。不同于语言领域中Transformer对RNN的快速替代,其在视觉生成任务中沿序列生成、条件编码、骨干替换与多模态扩展四个环节渐进渗透, ◼以代表论文为锚,我们将2013年以来生成式视觉的发展划分为五个阶段:VAE与GAN奠基(2013—2015年)、GAN主导高真实感生成(2016—2019年)、扩散复兴与理论统一(2020—2021年)、文生图爆发(2022年)、DiT与视频/多模态扩展(2023年至今)。 相关研究 ◼Transformer进入生成式视觉领域,经历了由局部模块引入到核心架构替换的渐进式演进。早期阶段,Transformer主要作为自回归生成器,将文本与图像表示统一为离散token序列,实现视觉内容的序列化建模:2021年DALL·E将文本token与图像token联合建模,证明图像可被token化、并以类似语言模型的方式生成。随后,随着CLIP等视觉语言模型的发展,Transformer进一步承担文本语义编码与条件信息注入功能,通过跨模态对齐提升对文本指令的理解能力;Imagen与StableDiffusion则推动大语言模型编码器与扩散模型相结合。 《AI系列深度17期:视觉智能为何引入Transformer?》2026-08-06 《AI系列深度16期:语言智能为何从RNN转向Transformer?》2026-08-06 ◼随着视觉数据token化与大规模训练范式的发展,Transformer开始进入生成模型的核心模块。2023年DiT以Transformer替代传统扩散模型中的U-Net骨干网络,在潜空间图像patch上建模,验证了视觉生成同样具备规模化扩展潜力;不过其改变的是网络骨干,而非扩散去噪范式本身。进一步来看,Transformer正逐步成为视频与多模态生成系统的统一建模框架,推动生成模型由单图创作向连续时空与多模态交互演进。整体而言,相比语言领域对RNN架构的全面替代,Transformer在视觉生成领域更多体现为渐进式渗透:从生成器、条件编码器到核心骨干网络逐步深化。 ◼我们认为,数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;我们认为物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,我们认为应重点关注。 ◼风险提示:技术迭代与产品化落地不及预期的风险;视频与多模态生成的时间一致性与可控性不及预期的风险;大模型厂商ARR增速放缓、云服务商资本开支不及预期的风险;智能驾驶及机器人商业化落地不及预期的风险。 内容目录 1.1.生成式任务的本质与起点............................................................................................................41.2.五阶段框架:从GAN主导到Diffusion接棒............................................................................41.3.标志性成果与学术演进................................................................................................................4 2. GAN路线:对抗生成的原理、巅峰与局限.........................................................................................6 2.1.对抗生成的基本原理....................................................................................................................62.2.从DCGAN到StyleGAN的演进.................................................................................................72.3.结构性局限....................................................................................................................................7 3.1.去噪生成的基本原理....................................................................................................................83.2. Diffusion对GAN的范式替代......................................................................................................93.3.效率与算力局限..........................................................................................................................10 4. Transformer如何一步步融入图像生成..............................................................................................10 4.1.环节一:自回归序列生成器......................................................................................................114.2.环节二:文本条件编码与注入..................................................................................................114.3.环节三:扩散骨干替换(DiT)................................................................................................114.4.环节四:多模态统一与时空扩展..............................................................................................124.5.核心结论:Diffusion为主角、Transformer为工程化骨干.....................................................13 图表目录 图1:生成式视觉学术派系与技术演进时间轴......................................................................................6图2:GAN对抗训练原理示意.................................................................................................................7图3:扩散模型前向加噪—反向去噪过程及潜空间扩散示意..............................................................9图4:Transformer融入图像生成历程时间轴.......................................................................................11图5:DiT与U-Net扩散骨干结构对比示意.........................................................................................12 表1:生成式视觉发展历程梳理..............................................................................................................4表2:生成式视觉标志性成果梳理..........................................................................................................5表3:GAN路线代表论文与核心贡献.....................................................................................................7表4:Diffusion路线关键论文与演进....................................................................................................10表5:Transformer在生成式视觉任务中的四个介入环节...................................................................13 1.复盘生成式视觉:从学习数据分布到自然语言生成内容 1.1.生成式任务的本质与起点 与图像分类、检测、分割等判别式任务不同,生成式任务的目标不是给定图像并输出标签,而是学习图像数据背后的生成规律,并在文本等条件约束下生成此前不存在的新图像。换言之,模型不是在“识别图像”,而是在学习大量图像背后的结构、风格与语义分布,并据此生成新的视觉内容。其难点在于:自然图像处于极高维空间,真实分布无法显式写出,如何用神经网络近似这一分布并高效采样,构成十余年来生成式视觉研究的主线。 2013—2015年是这一主线由传统概率图模型转向深度神经网络端到端训练的起点。2013年,Kingma与Welling提出变分自编码器(VAE),以变分推断与重参数化技巧训练潜变量生成模型,为生成模型提供了清晰的“编码—潜变量—解码”框架。 1.2.五阶段框架:从GAN主导到Diffusion接棒 我们梳理了2013年以来生成式视觉领域代表性成果,依据主导生成范式的更替,将其发展划分为五个阶段:从奠基期多条路线并立,到GAN主导高真实感生成,再到扩散模型复兴并完成范式替代,继而自然语言成为生成入口,最后骨干网络Transformer化、生成对象向视频与多模态扩展。 1.3.标志性成果与学术演