多模态智能的本质是将文本、图像、音频、视频等不同模态的数据映射进统一表示空间,在此基础上完成理解、推理、生成与交互。它是AI2.0架构、任务、模态三重收敛在模态维度的集中兑现,通过Transformer等技术实现不同模态信息的融合与协同处理,从而提升AI系统的泛化能力和实用性。
多模态技术发展分为三个阶段:阶段一(2021—2023年)外挂式/组合式,通过视觉编码器、投影层等将图像接入语言模型,但存在细节、空间关系和时序信息损耗;阶段二(2023—2024年)原生多模态,以Gemini为代表,将文本、图像、音频、视频从训练早期共同参与表示学习,提升泛化能力;阶段三(2024年至今)全模态Omni,如GPT-4o将多模态输入输出纳入同一实时交互闭环,补齐听、看、说的互动性。主线是对齐位置不断前移、转换损耗逐级下降,逐步从统一预训练推进到实时统一交互。
报告重点分析了多模态技术的未来发展方向:一是理解与生成统一,当前存在表征冲突,业界探索纯自回归、扩散及二者融合等范式,可能向模态表征与生成模块适度解耦、语义与推理主干共享发展;二是多模态深度推理,从语言扩展至图像、视频和具身场景,加速演进方向包括视觉工具增强、视觉—语言交错推理、多模态潜空间推理、世界模型与行动闭环,但以视觉表示或多模态潜变量为原生载体的推理尚处早期。
当前多模态技术市场处于从原生多模态向全模态Omni过渡的阶段。技术主线是对齐位置不断前移,模态进入同一个Transformer的时点持续提前,从统一预训练逐步向实时统一交互演进。视觉编码器、投影层等技术已相对成熟,但多模态深度推理仍处于早期,尤其在视觉表示或多模态潜变量为原生载体的推理方面存在较大发展空间。行业整体呈现技术快速迭代但商业化落地尚需时日的特点。
研报提示的主要风险因素包括:技术迭代不及预期,多模态技术发展存在路径不确定性;大模型厂商ARR增速放缓,可能影响研发投入;云服务商资本开支不及预期,将影响算力支持;智能驾驶及机器人商业化落地不及预期,可能延缓相关应用场景的拓展。这些风险需关注,但当前多模态技术仍处于快速发展期,长期发展潜力较大。