多模态大语言模型轻量化方法研究现状和展望
多模态大语言模型概述
- 定义:多模态大语言模型(MLLMs)融合了大语言模型与多模态处理能力,能理解和生成文本、图像、视频、音频等多元数据,实现跨模态任务处理,如视觉问答、视觉推理等。
- 轻量化必要性:尽管MLLMs性能优异,但其庞大的模型规模和高昂的训练、推理成本限制了广泛应用。例如,MiniGPT-v2训练耗时超800GPU小时,LLaVA-1.5-Vicuna-13B推理需18.2T FLOPS和41.6G内存,资源消耗巨大。此外,云端运行模式引发普及化和隐私保护担忧,高算力需求也限制了边缘设备应用。
多模态大语言模型轻量化方法研究现状
- 核心模块优化:
- 视觉编码器:通常沿用大规模模型中广泛采用的预训练视觉编码器(如CLIP),轻量化优化效果不如语言模型显著。
- 预训练大语言模型:采用参数少于30亿的小型轻量化模型(如phi2-2.7B、Gemma-2B)或使用模型压缩技术(量化、剪枝、知识蒸馏、紧凑架构、动态网络)对大语言模型进行轻量化。
- 视觉-语言投影器:通过基于注意力(Q-Former)、CNN(LDPv2)、Mamba(VL-Mamba)或混合结构(卷积抽象器)的轻量化设计,实现视觉特征到文本特征空间的映射。
- 视觉token压缩:
- 多视图输入:如LLaVA-UHD将高分辨率图像划分为小切片,LLaVA-PruMerge和MADTP通过适应性视觉token减少方法降低计算量。
- 多尺度信息融合:Mini-Gemini模型使用高低分辨率编码器结合块信息挖掘,VideoLLaVA基于LanguageBind统一视觉表示,避免计算负担。
- 高效的结构:
- 专家混合模型(MoE):如MoE-LLaVA通过稀疏M框架增加参数数量而不影响计算效率。
- Mamba:Cobra将Mamba融入视觉模态,性能媲美LLaVA但参数仅用43%。
- 推理加速:SPD通过推测解码仅使用语言模型,跳过图像token处理,提高推理效率。
展望
- 突破多模态信息处理局限:当前轻量化MLLMs通常仅接受单一图像,未来需支持更多元模态(如长视频、长篇文档),以实现更复杂的应用。
- 输入输出模态扩展:未来需扩大输入模态范围(如音频、传感器数据)并增强生成能力,拓宽应用领域。
- 边缘部署:轻量化MLLMs将推动机器人等智能设备发展,提升环境理解准确性、任务执行效率和人机交互能力。