您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:生成智能如何引入Transformer - 发现报告

生成智能如何引入Transformer

2026-08-14 - 未知机构 yuAner
报告封面

参会人:无参会人信息 1、生成式视觉本质与发展脉络 ·生成式视觉本质与任务差异:生成式视觉的核心本质是学习图像数据背后的分布规律,在文本等条件约束下生成新内容。它与图像分类、图像检测等判别式任务目标完全不同:判别式任务是给定图像输出标签,生成式任务则是学习图像背后的生成规律与语义分布,生成此前不存在的新图像。生成式视觉的核心难点在于自然图像处于极高维空间,真实分布无法显式写出,如何用神经网络近似实现该分布并高效采样,是十余年来生成式视觉研究的主线。 ·生成式视觉五大发展阶段:2013年变分自编码器提出,为生成模型提供了编码-潜变量-解码的清晰框架,是深度生成的起点。按主导范式更替,2013年以来的生成式视觉可划分为五大阶段,各阶段标志性成果与核心特征如下:a.奠基阶段,完成从传统概率图模型向深度神经网络训练的转向;b.GAN对抗生成阶段,标志性成果为GAN对抗式生成框架;c.去噪扩散生成范式兴起阶段,标志性成果为DDPM现代扩散架构;d.文本驱动图像生成爆发阶段,标志性成果包括核心贡献为图文对比学习方案的CLIP、推出潜空间扩散新架构的latent diffusion;e.2023年至今可控生成与视频扩展阶段,核心特征为可控生成,主导范式为DIT (diffusiontransformer),transformer替代U-Net成为去噪计算组件与生成骨干。 ·生成式视觉四条发展线索:生成式视觉发展主要沿四条核心技术路线展开,分别为显式概率与可逆模型线、对抗生成线、去噪生成线、自回归序列建模线,多条路线并行支撑生成式视觉的技术迭代。 2、对抗生成(GAN)路线解析 ·GAN路线发展与核心原理:2016-2019年是对抗生成路线作为生成式任务主线的发展阶段,该路线从基础框架逐步向高真实感、高可控生成方向演进,核心结构先后经历最初的GAN结构、卷积化实现训练稳定的DCGAN及后续多款变体。GAN核心逻辑为生成器与判别器的对抗博弈:生成器从随机噪声出发生成图像,判别器判断输入样本为真实或生成样本,二者交替优化,生成器以骗过判别器为目标,判别器以识别真伪为目标,直至生成样本难以与真实样本区分,本质是造假与鉴定双方相互较量、共同提升的过程。该框架在生成式领域意义重大,绕开了难以处理的自然计算,无需显式编写复杂概率分布,通过拮抗方式即可逼近真实数据分布。 ·GAN路线的优势与局限:GAN路线在高真实感图像生成领域建树突出,2018-2019年推出的BigGAN、StyleGAN模型,通过引入大规模类别条件、可控潜空间等技巧,将该路线的生成效果推至巅 峰。但GAN路线存在四点明显局限,是其被新范式替代的核心原因:a.训练不稳定;b.存在模式崩溃情况;c.缺乏显式的自然评估标准;d.语义与文本条件控制能力弱,生成内容随机性较强。基于上述局限,以去噪为核心逻辑的Diffusion范式逐步替代GAN路线成为生成式领域新方向。 3、去噪扩散(Diffusion)范式解析 ·扩散模型原理与发展历程:扩散模型核心思想起源于2015年基于非平衡热力学提出的早期研究,核心运行逻辑为加噪-去噪两步:前向过程通过多步加噪逐步破坏数据原有分布,以图像为例,即对清晰图像逐步加入高斯噪声直至变为接近纯噪声的雪花图;反向过程训练神经网络预测每一步添加的噪声,实现从纯噪声逐步还原清晰图像,本质是将生成过程转化为稳定的监督学习问题,和GAN的对抗博弈范式形成鲜明对比。发展路径方面,2020年DDPM架构的提出正式激活扩散模型,2022年latent diffusion将潜空 间 技 术 引 入 扩 散 范 式 并 结 合 交 叉 注 意 力 , 成 为StableDiffusion的技术基础,推动扩散模型完成从思想提出到工程落地的完整接力,其中标准DDPM需数十到上千步迭代去噪才可生成图像。 ·扩散模型的优势与局限:扩散模型数年内取代传统生成式模型成为技术主线,核心优势为解决了GAN的三大核心局限:一是训练更稳定,二是缓解模式崩溃问题提升覆盖度,三是可控性更强, 可注入文本约束条件。当前扩散模型的核心局限集中在效率与算力两大维度: a.采样速度慢,标准DDPM需要数十到上千步迭代去噪生成图像,推理成本远高于GAN的一次前向运算; b.像素空间算力开销大,直接在高维像素空间开展扩散的训练和推理成本较高,这也是潜空间技术被引入扩散范式的核心原因。 4、Transformer在生成式视觉的渗透 ·Transformer融入的四阶段路径:Transformer在生成式视觉中是渐进式渗透,而非全盘替代原有架构,其介入过程共分为四个阶段: a.第一阶段作为自回归序列生成器,2021年推出的DALL-E1首次将图像token与文本token拼接成统一序列建模,实现零样本文生图,证明图像可token化、视觉生成可像语言一样被序列建模,但受限于自回归的顺序依赖、推理效率及全局一致性问题,该范式未成为文生图主线; b.第二阶段作为文本条件编码器与注入机制,通过CLIP实现图文对齐,将文字条件约束注入生成范式,让自然语言成为图像生成的主要控制接口,很大程度上推动了2022年文生图的爆发,此时扩散生成组件仍为U-Net,Transformer仅承担配套角色; c.第三阶段替换扩散模型骨干计算网络,用DIT替代原去噪模块常用的U-Net,在潜空间图像块上建模,展现出良好的规模化特征,该阶段仅替换核心计算模块,未改造扩散加噪去噪的核心范 式; d.第四阶段作为统一多模态表示与时空建模骨干,支撑视频扩散模型将扩散范式拓展到视频领域,也可被整合进原生多模态模型、支持多轮编辑与文字渲染等方向,推动生成式视觉从单独创作走向视频与多模态创作系统,同时承担生成计算骨干与多模态对齐、统一的核心作用。 ·Transformer价值与核心结论:对比Transformer在语言领域对RNN架构的全盘替代,其在生成式视觉领域的定位存在明显差异,核心结论如下: 第一,生成式视觉本轮真正的范式层面替代是主流路线从对抗生成转向以扩散式Diffusion为主的去噪生成,Transformer并非生成式范式本身的更替者,仅承担工程化骨干升级、提供语言可控接口的作用,并未改变扩散加噪去噪的核心范式; 第二,生成式任务的性能提升并非仅由Transformer单独决定,而是由Diffusion范式的优势与Transformer的技术升级共同促成,任务解决的整体性能既依托于Transformer的架构能力,也与 任 务 本 身 的 解 决 方 案 范 式 高 度 相 关 , 比 如DiffusionTransformer的优秀生成性能,是两大技术优势叠加的结果;第三,Transformer在生成式视觉领域的渐进式渗透路径清晰,从验证序列建模可行性、打通语言控制入口、替换核心计算骨干到支撑多模态拓展的四个阶段,形成了完整的技术落地路径,相关结论可从学术与产业层面得到印证。