这份研报实测分析了谷歌的Omni、CDAVE 2.0、Happy Horse系列、MiniMax H3、Pixverse V6等多个AI视频模型,对比了它们在文生视频和图生视频赛道的能力和效果差异,重点关注了视觉能力、语义理解、持续一致性和生成效率等维度。
AI视频行业未来竞争将从单段视频生成转向完整生产工作流,需要模型能稳定控制角色、产品和场景,理解分镜因果关系并支持局部修改。目前多数模型基础视觉能力较好,但物理规律理解和指令执行仍是共性问题,影响制作成本和规模化应用。
研报重点实测分析了重力和惯性运动场景、AI真人短剧场景、AI动漫级短剧场景。结果显示,多数模型在运动画面流畅性上表现较好但物理规律理解不足,真人短剧场景中CDAVE 2.5等表现最佳但剧情执行不完整,动漫场景中CDAVE 2.0等表现优异。
当前AI视频市场主要问题包括物理规律理解不足、指令执行率低导致剧情细节遗漏、不同模型场景化分工明显但综合稳定性不足。此外,物理规律和指令执行问题也直接影响制作成本,如API单价和抽卡率等。
研报提示AI视频行业需关注模型物理规律理解能力不足可能导致的制作缺陷风险,以及指令执行率低带来的规模化应用障碍。同时,不同模型场景化分工明显,可能导致用户选择困难,需警惕技术路线单一化风险。