- 核心观点:MiniMax正式发布通用全模态生成模型H3,在原生全模态能力、任务与模态边界突破、商业应用及成本效率方面取得显著进展。
- 原生全模态能力升级:H3支持统一理解文本、图像、视频和声音组成的多模态上下文,并可生成原生双声道音视频,最高支持15秒、2K分辨率。模型进一步打通图像、视频和音频之间的任务边界,用户可通过自然语言完成跨模态参考、生成和编辑。
- 面向多元商业场景:H3在指令遵循、文字及品牌信息呈现、视频动作迁移等方面表现较好,可应用于广告、品牌、电商、产品设计、UI/UX及游戏等场景。
- 成本效率优化:通过模型架构和压缩效率优化,H3降低了训练及推理成本。