Sora文生视频大模型深度行业分析报告总结
一、Sora概述
- 发布背景:OpenAI于2023年2月发布首个视频生成模型Sora,能根据文字指令即时生成短视频。
- 实现功能:支持文生视频、图像生成动画、视频时间线扩展、视频编辑、视频无缝连接以及文生图像。
- 技术路径:采用基于Patches视觉特征标记的Diffusion Transformer模型,借鉴LLM的Tokens使用方式,将视觉数据转化为Patches,并通过视频压缩网络和Transformer模型进行视频生成。
- 算法实现:选择Patches实现更灵活的采样和优化构图,结合DALL·E3的描述性标题重述和GPT的标题扩写强化语言理解能力。
二、Sora功能优势及局限
- 功能优势:
- 多样化表现:直接在原始视频图像数据训练,采样灵活,改进构图与框架。
- 深化语言理解:通过DALL·E3的re-captioning技术和GPT扩写提升文本保真度和视频质量。
- 多样化提示:接受图像或视频等其他形式输入,实现图像赋予生命、视频时间线扩展、视频到视频编辑和视频无缝连接等功能。
- 图片生成能力:根据用户需求生成可变大小的图像,最高可达2048×2048分辨率。
- 新的模拟能力:模拟现实世界中的人物、动物和环境等,展现3D一致性、较长视频的连贯性和对象持久性,以及与世界和数字世界的互动能力。
- 局限性:无法准确模拟许多基本物理过程,如玻璃破碎等,交互场景中存在对象状态变化不一致等问题。
三、文生视频大模型发展现状
- 定义:由AI生成视频内容的大型机器学习模型,能处理文本、图像、音频、视频等内容作为提示,创造出自主生成的视频。
- 发展历程:2023年是文生视频模型的开启之年,诞生的模型达数十个,用户数量超过百万,但多数仍处于产品早期阶段,生成视频长度和质量有限。
- 未来趋势:2024年,各大公司加快研发步伐,有望迎来AI视频年,但科技巨头暂未公开其大模型产品。
- Sora模型:目前暂未对公众完全开放,仅提供给部分内测用户使用,以评估潜在风险。
四、代表性文生视频模型梳理及比较
- Pika:支持3D动画、动漫或电影等类型内容生成,具备生成和编辑功能,免费对公众开放。
- Gen-2:生成4k分辨率长达18秒视频,支持多种视频生成方式,采用套餐包订阅收费模式。
- Stable Animation SDK:支持文本转动画、文本与图像组合输入转动画、视频输入后文本调整输出动画,采用单次收费模式。
- Sora与其他模型对比:
- 超长生成时间:支持60s视频生成,主人物稳定,背景人物表现稳定。
- 单视频多角度镜头:能在单个生成的视频中创建多个镜头,模拟复杂摄像机运镜。
- 理解物理世界:不仅理解用户提示内容,还能理解其在现实世界中的存在方式。
五、Sora对算力网络需求拉动测算
- 训练侧:第一代Sora拉动相对有限,未来参数提升将大幅提升算力需求,训练YouTube全年生成视频大致需要7.09万张H100训练一个月的时间。
- 推理侧:推理侧算力需求更大,生成一次视频问答所消耗的算力大约是生成一次文字问答的1000倍以上。
- SORA模型算力空间测算:推算Sora架构的训练算力需求与传统大语言模型(LLM)Transformer架构的训练算力需求存在近百倍差距。
六、Sora将如何改变传媒各细分赛道
- 影视:降低传统影视制作门槛,IP类资产有望价值放大,影视制作公司将出现分化,拥有核心导演及IP资源的公司更受益。
- 营销:广告视频制作基础环节有望替代人力,为营销策划提供创意,提升广告相关视频的创造效率,增强广告吸引力,满足更低成本定制化需求。
- 游戏:模拟生成游戏视频,降低生产成本,帮助游戏开发者创立角色或背景故事,增加游戏情感故事背景提高可玩性。
七、相关公司
- 万兴科技:深耕数字创意,全面拥抱AIGC,发布万兴天幕音视频多媒体大模型,聚焦创作者经济,付费转化和粘性有望持续提升。
- 华策影视:影视行业引领者,加速布局AIGC,成立AIGC应用研究院,推出“影视剧本智能创作系统”,积极将AIGC应用于影视生产全链路。
- 易点天下:国内头部的全球化智能营销服务商,发布AIGC数字营销创作平台KreadoAI,覆盖营销投放前、中、后趋势洞察、素材营销效果数据分析和内容分析。