生成式视觉技术自2013年以来经历了五个主要发展阶段,围绕学习图像数据分布规律并在文本条件下生成新内容展开,共呈现四条演进线索:
发展阶段与演进线索
- 奠基阶段(2013年):以VAE(变分自编码器)提出为标志,奠定基础。
- GAN生成对抗阶段(2016-2019年):以生成器-判别器对抗博弈为核心,代表模型包括DCGAN、BigGAN、StyleGAN,但存在训练不稳定等四大局限。
- Diffusion去噪扩散阶段(2020-2022年):以DDPM(去噪扩散概率模型)和LatentDiffusion为关键节点,训练更稳定、可控性更强,但存在采样慢的局限。
- 文本驱动图像生成爆发阶段(2023年至今):可控生成与视频扩展成为新方向。
- Transformer渐进融入:分四环节逐步融入生成式视觉技术。
关键技术节点与局限
- GAN阶段:技术主线为生成对抗,但存在训练不稳定、模式坍塌、梯度消失/爆炸、计算资源消耗大等局限。
- Diffusion阶段:后Diffusion路线取代GAN成为主线,关键节点为DDPM(2020)和LatentDiffusion(2022),优势在于训练稳定性与可控性,但采样速度较慢。
- Transformer融入:逐步增强模型在文本条件下的生成能力,推动可控生成与视频生成的发展。
研究结论
生成式视觉技术从GAN的对抗博弈到Diffusion的去噪扩散,逐步实现了训练稳定性与可控性的提升,但采样效率仍是待解决的问题。未来发展方向包括更高效的采样方法、视频生成技术以及与Transformer的深度结合,以实现更灵活、可控的图像生成。