多模态模型迎来“Deepseek时刻”,供给革命将重新定义内容创作范式
多模态模型年初迎来重磅更新,视频生成模型迈入高精度、高可控阶段
2026年1月31日,快手发布新一代视频生成模型可灵(Kling)3.0系列,涵盖图片3.0和视频3.0,以及视频/图片一体化的Omni模式。2月6日,字节跳动发布新一代视频生成模型Seedance2.0。2月10日,字节与阿里同步更新图像生成基模,分别发布Seedream 5.0和Qwen-Image-2.0。这些更新标志着AI视频生成进入高精度、高可控阶段,从盲盒式娱乐向精准工业化生产跨越。
可灵3.0:深耕物理拟真与长逻辑叙事
可灵3.0在基础模型和生成编辑一体化能力方面进行了升级。基础模型方面,提升了主体一致性与连续性、复杂文本指令理解能力,以及文本与视觉角色的精准映射。Omni一体化编辑能力方面,支持对已生成内容进行局部修改,包括创建视频主体、分镜叙事、影视级叙事画面表达、批量组图输出,以及高清输出与细节表现。
Seedance2.0:定义工业级精准控制标准
Seedance2.0在基础层面显著增强,提升了物理规律合理性、动作表现自然流畅度、指令理解精准度,以及风格保持稳定性。关键优化包括一致性提升、高难度/可控的运镜和动作的精准复刻,以及创意模版/复杂特效的精准复刻。Seedance2.0还定义了多模态交互新范式,通过“@素材名”的方式指定每个素材的用途,大幅降低专业创作者的“废片率”。
可操作性优化拓宽应用边界
可灵和即梦视频和图片模型的语言理解能力和分镜能力提升明显,应用场景从单纯的娱乐内容向商业广告、电商营销、专业短剧预演等垂直领域扩充。可灵3.0更强调视频的整体感与电影级叙事,适用于精细化内容制作;即梦则聚焦在生产流的解耦与重组,更适合短视频营销、泛娱乐素材生产领域。
投资机会梳理
Seedance2.0、可灵3.0等优秀多模态视频模型发布,将直接催化至下游内容IP方、内容版权、AI应用工具等。此外,视频模型在推理侧频繁调用形成对云服务与算力需求的拉动。建议关注内容IP、内容版权、AI视频制作工具/模型,以及互联网平台/AI云服务。
风险提示
政策监管趋严、AI技术迭代发展不及预期、AI产品商业化不及预期。