文本丰富图像理解多模态大语言模型综述
本文对文本丰富图像理解(TIU)领域的多模态大语言模型(MLLMs)进行了系统性和全面的综述,涵盖了模型架构、训练流程、数据集与基准以及挑战与趋势。
模型架构
TIU MLLMs 通常包含三个核心组件:视觉编码器、模态连接器和LLM解码器。
- 视觉编码器:分为无OCR、基于OCR和混合三种方法。无OCR编码器如CLIP、ConvNeXt、SAM等,用于提取高级视觉特征;基于OCR编码器如BLIP-2、LayoutLMv3等,通过OCR技术捕获文本和布局信息;混合方法则结合了无OCR和基于OCR编码器的优势。
- 模态连接器:用于将视觉特征与LLM的语言特征对齐,常见的策略包括线性投影、多层感知(MLP)、交叉注意力、H-Reducer、C/D-abstract和注意力池化等。
- LLM解码器:利用LLM强大的理解能力进行语义推理,生成最终答案。常用的LLM包括LLaMA、Qwen、Vicuna、InternLM等。
训练流程
MLLMs的训练流程分为三个阶段:模态对齐、指令对齐和偏好对齐。
- 模态对齐:通过OCR数据和传统OCR任务的监督进行预训练,旨在弥合模态差距。常见的对齐方法包括识别、定位和解析三种类型。
- 指令对齐:通过监督微调(SFT)提升MLLMs的多模态感知和跨模态推理能力,增强对多样化指令的鲁棒性,并实现未见任务场景的零样本泛化。主要方法包括视觉语义锚定、提示多样性增强和零样本泛化等。
- 偏好对齐:通过偏好对齐技术优化模型输出,使其更符合人类价值观和期望。例如,InternVL2-MPO引入了混合偏好优化(MPO)策略,有效提升了多模态推理能力。
数据集与基准
TIU任务的快速发展得益于大量专用数据集和标准化基准的出现。数据集可分为特定领域(文档、图表、场景、表格和GUI)和综合场景两种类型。常用的基准包括DocVQA、InfoVQA、ChartQA、TextVQA等。
挑战与趋势
尽管当前MLLMs取得了显著进展,但仍面临一些挑战:
- 长文档理解能力:MLLMs在单页文档理解方面表现出色,但在多页或长文档任务上的性能仍有待提升。
- 计算效率和模型压缩:当前MLLMs的计算需求较高,需要开发更高效的架构来平衡性能和计算开销。
- 多语言文档理解:现有MLLMs主要针对英语和高资源语言进行优化,在多语言和低资源语言场景下的性能不足。
未来研究方向包括:
- 优化视觉特征表示:开发高效的视觉编码器、自适应token压缩机制和先进的跨模态特征融合技术。
- 提升长文档理解能力:通过长文档理解基准(如MMLongBench-Doc)推动相关研究。
- 增强多语言文档理解:构建包含多样语言和文化背景的综合多语言数据集,并利用跨语言迁移学习技术提升模型在多语言场景下的性能。
研究结论
本文系统地分析了TIU MLLMs的研究现状,并指出了未来研究方向。随着技术的不断发展,MLLMs将在文档理解、图表解释、自然场景文本理解等领域发挥越来越重要的作用。