一、核心定义
多模态大模型是能够同时处理文本、图像、音频、视频等异构数据的AI模型,打破了单一模态的信息边界,可实现多源感知信息的统一理解与深度融合,支持跨模态的联合理解、生成或转换 【2】 【6】 。这里的“模态”本质就是不同类型的输入/输出数据,比如我们常见的文字、图片、语音都属于不同模态 【6】 。
二、技术相关特点
- 技术架构:通常由编码器、桥接层、LLM骨干网络三部分组成,核心是通过编码器和桥接层提取各模态的特征,再把这些特征有效融合进骨干网络中 【5】 。
- 主流技术路线:当前主要分为理解和生成两大类型,技术路线还未完全收敛,是全球大模型厂商重点攻坚的方向 【1】 。其中多模态理解模型有两类典型路线:一类是基于语言大模型底座,搭配多类外部专家模型共同完成多模态处理;另一类是通过跨模态特征对齐学习,实现多模态输入的统一融合,比如OpenAI的CLIP模型就通过对比学习,把图像和文本的编码向量在向量空间做对齐,以此理解两者的关联关系 【1】 。
- 训练流程:一般分为两个核心阶段,第一阶段是多模态交错数据预训练,用大规模多模态交错数据让模型初步建立跨模态关联;第二阶段是指令微调,让模型可以理解并遵循多模态场景下的用户指令 【10】 。
- 现存挑战:首先需要弥合不同模态之间的语义鸿沟,其次随着模态数量增加,多模态任务的组合空间会指数级增长,在充分训练、调和不同模态的相互影响、模型效果评估等方面都存在不少新的待解难题 【5】 。
三、产业发展情况
- 发展历程:早在1956-2006年深度学习、神经网络技术的发展就为大模型打下了基础,2006年后Transformer架构等技术成熟让预训练大模型成为NLP领域主流,2022年底ChatGPT带火全球大模型热潮,2023年国内出现“百模大战”,2024年中国AI大模型产业正式加速进入商用阶段 【3】 。
- 市场规模增速:预计2025-2034年全球多模态大模型市场的复合年均增长率(CAGR)可达37% 【4】 ;国内市场的增长速度更快,2024-2030年中国多模态大模型市场规模CAGR有望达到67%,其中2024年市场规模为107.45亿元,预计2030年将增长至1030.9亿元 【7】 。
- 主流标杆模型:国际上有GPT-4o、Gemini Advanced、Claude 3 Opus等前沿模型,国内也有文心一言4.0、通义千问3.5、腾讯hunyuan-vision、商汤日日新、字节云雀、豆包系列等代表性产品 【2】 【3】 【11】 。
四、下游应用与商业模式
- 覆盖场景:应用已经渗透到生活娱乐、生产制造、公共服务等多个领域,包括工业、农业、教育、游戏、基建、交通、金融、医疗、应急等细分赛道,是垂直领域快速实现智能化升级的核心驱动力——比如医疗场景可以融合电子病历、CT影像、心电图等多类数据辅助诊断,工业场景可以关联设备噪声、温度曲线、操作日志优化生产工艺 【8】 【9】 。
- 主流商业模式:目前行业主要有三类成熟模式:
- SaaS模式:把多模态大模型做成应用或网页小程序直接给用户使用,面向个人和中小企业,靠广告、订阅、按token/次数计费盈利 【14】 。
- PaaS模式:提供完整的软件开发平台,支持用户二次开发,面向有开发需求的中小企业,靠订阅、定制化服务、二次开发分成盈利 【14】 。
- MaaS模式:把大模型的功能或整体封装为API接口提供给开发者/企业合作伙伴,对接进企业自有产品,主要面向中大型企业,盈利方式包含订阅、定制化服务、按token/次数计费、二次开发分成等 【14】 。