生成模型演进与核心差异
生成模型的核心目标是学习数据分布并生成新样本,与判别模型不同,生成模型关注如何从噪声、潜变量或条件输入中生成数据。生成模型演进可分为五条脉络:VAE(显式概率和潜变量建模)、GAN(对抗训练点燃高真实感图像生成)、自回归模型(图像token序列建模)、DDPM(加噪和去噪过程重塑范式)以及得分/流匹配模型(统一扩散、得分模型和连续生成路径)。2022年后,扩散与Transformer结合的DiT证明生成路线也可接入规模化骨干,并支撑图像、视频和世界模型方向发展。
GAN与Diffusion的核心机制与差异
GAN 以生成器和判别器的对抗博弈为核心,通过极小极大博弈逼近数据分布。其优势在于可一步生成图像,图像锐利,适合实时生成和特定垂类,但训练不稳定、易模式崩溃且规模化难度高。
Diffusion 以加噪和去噪过程为核心,通过逐步加噪再学习去噪过程完成采样。其优势在于训练稳定、分布覆盖更全、条件控制更强,但推理慢、算力开销大。
GAN与Diffusion的四维差异
- 采样速度:GAN一步生成,图像锐利;Diffusion多步去噪,推理慢。
- 训练稳定性:GAN对抗训练易不稳定,Diffusion去噪回归训练稳定。
- 样本多样性与分布覆盖:GAN易模式崩溃,Diffusion覆盖更全。
- 可控性与编辑能力:GAN控制偏弱;Diffusion通过CFG、inpainting等手段实现强可控与可编辑。
主流技术路线与演进方向
当前图像和视频生成的通用主线已转向Diffusion及其流匹配变体,如Stable Diffusion、DALL-E2、Sora等。但GAN并未退出,仍在实时生成、特定垂类和扩散提速中发挥作用。
Diffusion的演进方向:
- 流匹配与整流:通过更直接的生成路径降低采样成本,如Flow Matching、Rectified Flow和Stable Diffusion 3。
- 一致性模型与蒸馏:将多步生成压缩为少步生成,如Consistency Models、LCM-LoRA。
- 扩散与Transformer:DiT证明扩散主干可替换为Transformer,实现可扩展性,如Sora等视频生成大模型。
- 对抗思想回流:GAN用于扩散提速,如对抗蒸馏将GAN的对抗损失用于扩散模型压缩。
产业落地:
- 数字AI侧:形成“扩散/流匹配+Transformer/DiT”的统一技术栈,竞争焦点转向数据、工程化、成本和产品体验。
- 物理AI侧:生成式世界模型用于合成长尾驾驶场景、仿真训练和机器人动作生成,但进入安全闭环还需补足动作条件化、长时域一致性和可靠评估。
研究结论:
数字AI底座模型发展路径已逐渐清晰,价值在于确定性,但其难以实现物理世界的建模闭环。物理AI将成为物理世界的AI解决方案,在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,应重点关注。
风险提示:
- 技术迭代不及预期的风险
- 大模型厂商ARR增速放缓的风险
- 云服务商资本开支不及预期的风险
- 智能驾驶及机器人商业化落地不及预期的风险