视频大模型的最新进展与分析
开源AI大模型的理论发展
- 多模态大模型:Aditya Ramesh在2024智源大会上介绍了多模态大模型领域的发展趋势。从DALL·E、iGPT到CLIP,再到Sora,OpenAI展示了从无条件的自回归图像Transformer到对比损失学习成对的文本-图像数据集的转变。
视频大模型的实际应用
-
Adobe Firefly:Adobe Firefly增加了生成音频和视频的功能,计划推出新的生成式扩展功能。用户可以使用特定计划获取生成积分,每月可生成或修改图像一次,支持大规模商用。
-
Adobe Express:Adobe Express推出了音频生成动画功能,提供便捷的口播视频制作方案,支持16种语言,旨在简化视频创作流程。
-
美图MOKI:美图发布了AI短片工作流工具MOKI,解决内容创作中的故事成片难、可控性差的问题,通过AI辅助实现内容和成本的双重可控。
-
万兴Filmora:万兴Filmora上线了AI功能更新,包括声音复刻、文生贴纸、AI动感字幕、弯曲文本和仿射变换等新功能,携手英伟达开启全新视频体验。
-
Luma AI Dream Machine:Luma AI发布了Dream Machine,实现了高质量的文生视频、图生视频,具备多模态输入、快速生成和高真实感的特点。
-
快手可灵大模型:快手发布了可灵大模型,模仿Sora的技术框架,专注于高清视频生成与物理特性模拟,支持复杂的运动场景建模。
-
Pika:Pika进行了大规模融资,构建了AI视频生成的基础模型,展示出良好的发展前景。
结论与投资建议
综合以上分析,视频大模型技术正快速发展,应用场景逐渐多元化,商业化进程加快。各企业通过技术创新和资源整合,推动视频生成技术的普及和应用。投资建议关注技术领先、商业化潜力大的企业,同时注意技术迭代风险和市场竞争格局的变化。
风险提示
- 技术迭代风险:视频大模型技术快速演进,可能面临技术替代的风险。
- 商业化落地风险:尽管技术发展迅速,但仍需关注实际应用的推广速度和市场接受度。
- 竞争加剧风险:随着投入增加和技术进步,市场竞争可能会加剧。
- 全球经济风险:全球宏观经济状况可能影响企业运营和市场需求。
图表目录
- 图1:DALL·E模型能力随规模扩张增强
- 图2:CLIP模型同时输入文本与图像数据进行训练
- 图3:模型规模与计算效率的关系示意图
- 图4:视觉上下文学习的可行性路径
- 图5:Adobe Firefly AI产品矩阵
- 图6:Adobe Express Animate from Audio功能展示
- 图7:美图MOKI文生视频产品预告
- 图8:Filmora声音复刻功能演示
- 图9:Filmora AI动感字幕功能介绍
- 图10:Dream Machine文字指令生成视频示例
- 图11:快手可灵大模型技术路线概览
- 图12:Pika B轮融资金额与估值
- 图13:Luma AI Dream Machine与Pika可灵大模型对比分析
- 图14:Luma、Pika、Runway视频大模型试用效果展示
参考文献与资料来源
- 智源社区公开演讲资料
- Adobe、美图、万兴科技、Luma AI、快手、Pika官方公告与新闻稿
- 技术论坛与博客文章