OpenAI发布Sora模型:视频编辑与物理模拟能力突出
Sora模型概述
- 核心能力:文本理解和物理模拟。
- 应用场景:生成不同长度、尺寸、分辨率的视频或图像,最高可达60秒。
- 当前状态:仅部分向创作者开放。
技术亮点
- 采样灵活性:原生大小训练,适应不同宽高比的视频素材。
- 构图与取景优化:原始纵横比训练提高构图与取景质量。
- 言语文本处理:通过DALL·E3训练,实现高质量视频生成。
- 图像与视频编辑:支持图像和视频的编辑操作,如循环视频、静态图像动画制作、视频延时等。
- 物理模拟能力:模拟现实世界中的人、动物与环境交互,增强视频的真实感。
ChatGPT技术进展
- 平台化演进:ChatGPT技术迭代,支持多模态融合,成为支持多种应用和服务的基础平台。
- 新模型发布:GPT-4 Turbo支持视觉、文本转语音、自动语音识别等,进一步提升多模态能力。
应用展望
- 视频质量:细节处理精细,呈现质量优秀。
- 视频编辑:实现多镜头切换,保持内容风格一致。
- 物理模拟:提高视频的真实感,模拟现实世界交互。
投资建议
- 关注领域:视频质量、影视级功能、真实物理模拟及应用场景落地。
- 重点公司:中文在线、紫天科技、上海电影、昆仑万维、易点天下、捷成股份、因赛集团、华策影视、果麦文化、丝路视觉、凡拓数创等。
- 风险提示:AI技术进展、应用落地及政策监管风险。
结论
OpenAI发布的Sora模型展现了强大的视频生成能力和物理模拟功能,为视频编辑和内容创作带来了革命性的改变。随着ChatGPT技术的不断演进,AI多模态能力的提升有望推动更多领域的创新,特别是影视、游戏、营销、电商、教育等行业。投资机会集中在能够有效利用这些技术的公司上,同时需关注技术进展、应用落地速度及潜在的政策风险。