报告导读: 目前视频生成模型相比于LLM仍处于较早期阶段,技术范式尚未完全收敛,近期部分观点认为多模态能力更接近模型能力组件,而非推动智能能力上限提升的核心主线,但这均不影响多模态模型离商业化相对比较近。我们认为AI视频生成赛道仍有不错的商业模式,产业趋势持续向好,正处于商业化加速验证期。从技术端和产业端来看,AI视频生成赛道都迎来积极的边际变化: 1、技术端:7月31日,Seedance2.5正式发布,相较于2.0重点突破:单次生成时长提升至30秒;多模态参考素材提升至50个;精准编辑。模型进一步释放生产力,且应用场景扩充至具身智能、工业制造、汽车等行业。同日,Minimax发布全模态生成模型H3,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频。 2、产业端:1)短剧持续爆发:据中国网络视听协会,26Q1,新上线AI微短剧数量占比超95%。据DataEye,今年1月至5月AI剧/漫剧市场规模已突破220亿元,全年有望冲击400亿元。2)长剧/电影领域拓展:《太平年》中可灵AI深度参与部分虚拟场景及视觉特效镜头的创作。国内首部获得《网络剧片发行许可证》的全流程AIGC网络故事片《奇谭:纸刃渡荒墟》登陆爱奇艺,标志着中国AIGC影视从AI短片/概念片到AI商业长片的突破。 在技术不断迭代推动之下视频生成产业趋势持续向好,我们看好赛道商业化潜力爆发。后续核心关注及潜在催化包括:Seedance 2.5实际效果、ARR转化;H3实际效果及商业化贡献;其他模型Kling等更新及ARR。 本系列将就以下问题做答:1)视频生成模型发展进程与技术迭代路线?技术瓶颈?2)以海外为鉴,Sora关停启示?3)核心玩家对比及自身迭代复盘?4)商业化变现途径?市场空间?5)竞争壁垒和格局?6)产业链玩家? 投资逻辑: 本篇报告将聚焦于前三个问题进行分析: DiT为目前主流基础架构,但技术范式尚未完全收敛。视频生成模型经历了从以GAN/VAE为代表到Token化Transformer与Diffusion并行发展再到DiT规模化,已呈现出Scaling效应,但尚未迎来类似LLM的技术范式收敛时刻。下一阶段技术突破仅靠继续扩大模型规模、训练数据或许还不够,核心目标或将是推动模型从拟合表面规律走向学习可预测的动态关系,提升复杂场景下的物理合理性。 Sora是AI视频生成行业重要转折点之一,其关停表明模型能力突破并不必然转化成商业成功。Sora实现了生成时长突破;复杂提示词理解能力增强;时序一致性与画面稳定性明显提升;部分初步模拟能力。Sora今年全面关停,主要系,1)战略聚焦:OpenAI全力备战IPO,叠加应对Anthropic的竞争,将资源聚焦到Coding、企业服务等核心领域;2)商业模式未跑通:用户热度不持久,粘性低,收入和成本倒挂。3)版权增加约束。从核心玩家对比来看,视频模型各有千秋和侧重。Seedance 2.5更偏向“全模态长叙事与创作控制模型”,拥有最大规模的多模态参考数量、最长的单次生成时长和专业级精细编辑;Kling 3.0系列更偏向“角色一致性与可控分镜模型”,优势在于分镜级精细控制和跨镜头主体一致性;H3更偏向“全模态理解与参考编辑模型”,核心优势在于跨模态素材理解,对生成、参考和编辑任务的统一支持;Veo 3.1更偏向“高画质镜头生成与延展模型”,核心优势在于高质量短镜头、首尾帧控制和连续视频延展。 风险提示 技术发展不及预期;竞争加剧;商业化进程不及预期等。 内容目录 一、视频生成模型历史发展进程与技术迭代路线如何?...............................................31.1技术迭代:从Diffusion/自回归Transformer过渡至DiT为主流...............................31.2当下瓶颈:从拟合表面规律走向学习可预测的动态关系.......................................6二、以海外为鉴,Sora关停的启示?..............................................................72.1 Sora的突破:时长+文本理解+时序一致性+初现世界模拟.....................................72.2 Sora的关停:战略+商业模式未跑通+合规等问题共同导致....................................8三、核心玩家对比以及自身迭代版本复盘?.........................................................93.1对比:Seedance重全模态长叙事与控制、Kling重角色与分镜、H3重全模态理解与参考编辑、Veo重镜头质量与延展...............................................................................93.2Seedance历史迭代:从高质量视频生成迈向统一多模态与长叙事创作..........................133.3 Kling历史迭代:从视频生成可用化迈向统一多模态与专业叙事创作..........................14四、风险提示..................................................................................16 图表目录 图表1:视频生成模型历史发展及技术迭代路线....................................................3图表2:GAN结构图.............................................................................4图表3:VAE结构图.............................................................................4图表4:DiT架构...............................................................................4图表5:U-Net对比Transformer.................................................................5图表6:Google Veo 3架构.....................................................................5图表7:可灵Omni架构.........................................................................6图表8:视频生成模型在物理推理基准上的表现....................................................7图表9:Sora视频生成核心流程..................................................................7图表10:Sora 2核心升级.......................................................................8图表11:Sora APP月度下载量...................................................................9图表12:Sora APP月度消费者支出...............................................................9图表13:Seedance 2.5 VS Kling 3.0 Omni VS H3 VS Veo 3.1.....................................10图表14:HappyHorse 1.1 VS PixVerse V6 VS Vidu Q3系列........................................12图表15:Seedance历史版本....................................................................13图表16:Kling历史版本.......................................................................15 一、视频生成模型历史发展进程与技术迭代路线如何? 1.1技术迭代:从Diffusion/自回归Transformer过渡至DiT为主流 我们复盘视频生成模型历史发展及技术迭代路线,大致可以归为四大阶段,分别是早期学术探索阶段(2021年之前)、Token化Transformer与视频扩散并行发展期(2021-2023年)、DiT规模化期(2024-25Q1)和原生音视频与多模态创作产品化期(25Q2-至今)。 2021年之前:早期学术探索期,以GAN(生成式对抗网络)和VAE(变分自编码器)为代表。 GAN通过“生成器—判别器”对抗训练生成视频:生成器根据随机噪声或条件信息合成视频,判别器判断视频来自真实数据还是生成器,生成器据此不断提升结果的真实性。VAE在训练时将视频压缩成带有随机性的潜变量,并训练解码器根据这些潜变量还原视频,训练完成后,模型可以随机采样一组潜变量,再由解码器生成一段新视频。当前视频模型仍使用Video VAE等进行时空压缩与解码,VAE更多承担“视频压缩器和解码器”的角色,而不是直接决定生成视频的内容。 GAN需要让生成器和判别器不断博弈,一旦双方训练失衡,模型就可能难以收敛,或反复生成少数几类相似视频,从而影响内容多样性。与图像生成相比,视频生成还需要学习物体运动和帧间一致性,而随着分辨率和视频时长提高,时空数据规模、计算及显存需求增加,对抗训练更加困难。受当时模型架构、算力和训练稳定性等限制,早期视频GAN集中于低分辨率、短时长视频生成。VAE通常要求生成视频在每个像素上尽量接近真实视频。当同一场景存在多种合理的运动或细节变化,而潜变量又未能充分区分这些可能性时,模型可能在不同结果之间取 折中,导致画面偏平滑、边缘模糊,细节和纹理不足。 来源:Wikimedia Commons,国金证券研究所 来源:Google for developers,国金证券研究所 2021-2023年:Token化Transformer与视频扩散并行发展。当时主流路线: 1)基于扩散模型Diffusion生成视频:训练时不断向真实视频加入噪声,让模型学习反向去噪,生成时从随机噪声出发,在文字提示的引导下经过多轮去噪,逐步形成清晰视频。传统扩散模型通常采用U-Net作为去噪网络,通过逐级压缩和恢复视频特征、融合不同尺度的信息,预测每一步需要去除的噪声。该路线优势是通常能够生成质量较高的内容、训练相对稳定,缺点是需要多次迭代,生成速度较慢。代表模型为RunwayGen-1等。 2)基于Transformer架构大语言模型生成视频:像语言模型一样预测视频Token。模型先将文字、图像、视频音频压缩为离散化Token,再根据已有Token依次预测后续Token,注意力机制可以寻找不同画面、时间和输入条件之间的关联。该路线优势是能以统一的Token序列处理多种模态,在同一模型中灵活组合多种输入和生成任务,缺点是生成速度较慢,