文生视频与应用实践
快速发展的文生视频
文生视频技术正快速发展,主要基于扩散模型。该技术面临三大核心困难:
-
动作建模合理
- 数据层面:开源视文数据量小(约10M量级)
- 模型层面:视频动作分布差异大,建模困难
- 资源层面:高纬度计算复杂度高,训练低效
-
语义对齐准确
- 数据层面:开源视文数据脏、噪声大、粒度粗;中文和中国元素缺少
- 模型层面:CLIP文本语义表征能力有待增强
-
画质细节精美
- 数据层面:开源视文数据分辨率低、有水印
- 模型层面:图片超分和传统视频超分不适用
解决方案与效果
- 动作建模:设计空域-时域交替训练+多时域尺度训练,引入运动信息embedding,提升时序建模能力;设计空间引导注意力机制解决画面突变问题。
- 语义对齐:设计局部划窗高斯平滑算法实现高分辨率/超长视频超分。
- 画质提升:设计初始化Noise迭代保留低频信号,实现稳定画面生成。
视频生成的应用实践
文生视频&图生视频应用案例
-
视频风格化转换
- 用户输入视频,选择风格,生成对应风格视频(最长15s)。
- 技术实现:denoising阶段叠加控制信息(线条、深度图等)。
-
人体姿态控制
- 用户输入参考图片和运动模板,生成视频中人物主体跟随运动,背景保持一致。
- 应用于舞蹈生成、定制化广告生成等。
- 技术实现:自研condition merger模块融合纹理、动作序列、语义等信息。
-
视频运动笔刷
- 用户输入图片,选择主体,输入指令,主体跟随指令运动。
- 技术实现:denoising阶段在初始噪声基础上添加图片信息并计算光流指定运动区域。
交互方式与效果展示
一些不太长远的展望
- Sora vs Others
- Video Compression network
- Latent Diffusion Transformer
- Scaling up
- "Scaling video generation models is a promising path towards building general purpose simulators of the physical world." --Sora