H3是MiniMax推出的开放通用多模态视频模型,支持文本、图片、视频和音频混合输入,最多可处理12份素材,单次生成5-15秒、24FPS视频,支持1440p和原生双声道。其核心能力包括复杂动作、物体关系、指令遵循和多参考一致性。
在商用场景方面,H3主打高变现潜力领域,如广告、电商、游戏和UI设计。这些场景预算明确、需求高频,且客户常需反复修改素材内容。墨镜广告、赛博朋克案例和动态海报的实测效果表明,H3能有效处理多模态素材并实现精准修改。审美能力是决定客户是否采用及返工次数的关键因素。
多模态是下一代大模型的主线,市场潜力巨大。Gartner预测,到2027年多模态方案将占生成式AI解决方案的40%,Stanford AI Index也指出视频模型正从生成画面走向多模态理解。广告、电商、游戏和UI领域最需要这些能力,有望最快实现商业价值。
H3被视为赔率标的,兼具模型升级溢价和价格优势。保守预期下,其年收入可达400e美金;中性预期下,年收入可达1400e美金,对应2+赔率。M3的前置验证和自建算力仍提供训练试错机会。