事项:字节跳动研究团队发布OmniHuman人体动画生成框架,基于Diffusion Transformer的多模态条件驱动技术,通过单张图片和音频、视频等信号生成高度逼真、支持任意比例和风格的动态人类视频,标志着AI技术在人体动画方向上的突破,有望应用于影视、娱乐、游戏等领域。
评论:
- 混合多模态训练,实现更高泛化能力:OmniHuman采用Omni-Conditions Training策略,通过弱条件助力强条件、提高弱条件训练比例,克服高质量数据稀缺问题,从大规模数据中学习自然运动模式,支持多种输入模式并提升生成质量。
- DiT架构,提高视听契合度:采用基于DiT架构的视频生成框架,兼容多种模态条件注入方式,通过交叉注意力与视频特征融合,实现语言、音频与动作生成的高度契合度,适应多种模态。
OmniHuman整体效果显著优于行业领先方案:
- 在肖像和身体动画任务中,单一模型表现优于专业模型。
- 在所有评估指标中取得最佳结果,特定数据集中几乎所有指标表现出色。
- 消融研究验证训练策略有效性:音频和姿态比例设置为50%效果最佳,混合数据训练显著提高模型性能。
- 可视化效果显著提升:能保持输入运动风格,兼容风格化人形和2D卡通角色,甚至为非人类图像赋予动画效果。
投资建议:AI大模型应落脚垂类应用,看好国内大模型竞争力及商业化落地,建议关注办公、金融、大模型、工业、端侧/穿戴/玩具、医疗、法律、邮箱、创意、教育、电商、ERP、OA、安全、部署、算力等领域的相关标的。
风险提示:商业化表现不及预期、用户付费意愿低、行业技术迭代速度快。
一、OmniHuman运用全新框架,突破技术瓶颈
(一)运用混合多模态训练,实现更高泛化能力:通过弱条件助力强条件、提高弱条件训练比例,从大规模数据中学习自然运动模式,支持多种输入模式并提升生成质量。
(二)采用DiT架构,提高视听契合度:兼容多种模态条件注入方式,通过交叉注意力与视频特征融合,实现语言、音频与动作生成的高度契合度。
二、OmniHuman整体效果取得显著优势
- 在肖像和身体动画任务中,单一模型表现优于专业模型。
- 在所有评估指标中取得最佳结果,特定数据集中几乎所有指标表现出色。
- 消融研究验证训练策略有效性:音频和姿态比例设置为50%效果最佳,混合数据训练显著提高模型性能。
- 可视化效果显著提升:能保持输入运动风格,兼容风格化人形和2D卡通角色,甚至为非人类图像赋予动画效果。