视觉生成模型发展历程
视频生成领域经历了快速发展,从早期基于流模型的分布可逆变换,到现代的去噪扩散概率模型(DDPMs)和视觉扩散模型(VDMs)。VDMs的关键要素包括潜空间扩散、像素扩散、U网和转换器,其中Sora模型实现了高保真度、一致性,并能生成长时视频(如1分钟)。关键技术包括MAGViT、DALL-E 3、NaViT和TheDiT框架。
物理世界建模挑战
物理世界建模具有复杂性和不确定性,难以通过概率方法完全模拟。Sora模型需要消耗巨大资源(1亿张图片、1000万小时视频、10万亿token),但在几何、外观、照明和动画等方面仍存在故障案例。多视图图像和视频生成仍需几何增强,如Stag4D模型从时间角度进行4D高斯生成。
确定性条件应用
应用确定性条件可以减少数据和参数消耗,提高生成质量。具体方法包括:
- 图像人类动画:冠军模型为可控和一致的人脸动画3D参数引导,哈喽模型通过分层音频驱动进行人像动画。
- 动态蛋白质结构预测:基于参考引导的时间对齐4D扩散模型。
未来工作方向
未来工作将应用确定性条件于概率扩散模型,特别是在照明、几何和动作动画方面,以进一步减少数据和参数消耗,提高生成效果。