一、Sora概述
OpenAI于2024年2月16日发布了首个视频生成模型Sora,该模型能够根据文本指令即时生成长达60秒的高清视频,并具备多种功能,如根据图像生成动画、视频编辑、视频无缝连接等。Sora采用基于Patches视觉特征标记的Diffusion Transformer模型,并借鉴了DALL·E3的画质和遵循指令能力,以及GPT的语言理解能力。
二、Sora功能优势及局限
Sora生成的视频具有多样化表现,包括直接在原始视频图像数据上训练、采样灵活、改进构图与框架等。此外,Sora深化语言理解,能够接受图像或视频等其他形式的输入,进行图像赋予生命、视频时间线扩展、视频到视频编辑、视频无缝连接等操作。Sora还具有图片生成能力,能够根据用户需求生成可变大小的图像。然而,Sora目前仍存在局限性,例如无法准确模拟许多基本相互作用的物理过程。
三、文生视频大模型发展现状
文生视频大模型是一种能够由AI生成视频内容的大型机器学习模型,目前较为成熟的模型思路有循环网络、生成对抗网络和扩散模型。2023年是文生视频模型的开启之年,2024年各大公司加快了文生视频模型的研发步伐,有望迎来AI视频年。目前公开的模型大多来自初创公司,科技巨头多暂未公开其大模型产品。Sora模型目前暂未对公众完全开放,仅提供给部分内测用户使用。
四、代表性文生视频模型梳理及比较
代表性文生视频模型包括Pika、Gen-2和Stable Animation SDK等。Sora与其他AI文本视频模型相比,具有超长生成时间、单视频多角度镜头、理解物理世界等优势。
五、Sora对算力网络需求拉动测算
Sora的训练侧算力需求拉动相对有限,但未来随着参数提升拉动作用有望大幅提升。推理侧算力需求拉动更大,或千倍于文字。根据测算,Sora架构的训练算力需求存在近百倍差距于传统大语言模型。
六、Sora将如何改变传媒各细分赛道
Sora将对影视、营销和游戏等传媒细分赛道产生深远影响。在影视领域,Sora或降低传统影视制作门槛,IP类资产有望价值放大;在营销领域,广告视频制作基础环节有望替代人力,为营销策划提供创意;在游戏领域,模拟生成游戏视频,降低生产成本。
七、相关公司
相关公司包括万兴科技、华策影视、易点天下等。万兴科技全面拥抱AIGC,发布国内首个音视频多媒体大模型“天幕”;华策影视加速布局AIGC,推出“影视剧本智能创作系统”;易点天下发布AIGC数字营销创作平台KreadoAI,提供AI数字人、AI模特、AI工具、AI创意资产等解决方案。