您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [美团]:多模态大语言模型在富文本图像理解中的应用:全面综述 - 发现报告

多模态大语言模型在富文本图像理解中的应用:全面综述

信息技术 2025-02-23 Pei Fu, Tongkong Guan, Zining Wang, Zhentao Guo, Chen Duan, Hao Sun, Bom ing Chen, Jiayao Ma, Qianyi Jiang, Kai Zhou, Junfeng Luo 美团 黄崇贵-中国医药城15189901173
报告封面

121314111111Meituan,234MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences{fupei,duanchen02,wangzining03,chenboming,majiayao02}@meituan.com{jiangqianyi02,zhoukai03,luojunfeng}@meituan.comgtk0615@sjtu.edu.cn,hao.sun@cripac.ia.ac.cn,zt_guo1230@163.com沛福通坤关王子宁郭振涛陈段郝孙陈 bombing马佳瑶钱毅江周凯罗俊峰上海交通大学北京理工大学 文本丰富的图像理解(Text-rich image understanding),其包含两大核心能力:感知和理解。感知维度侧重于视觉识别任务,例如文本检测(Liao等人,2022年)、文本识别(Guan等人,2025年)、公式识别(Truong等人,2024年;Guan等人,2024a)以及文档布局分析(Yupan等人,2022年)。相反,理解维度则需要语义推理,用于关键信息提取和基于文档的视觉问答(例如,DocVQA(Mathew等人,2021b)、ChartQA(Masry等人,2022年)和TextVQA(Singh等人,2019年))。 摘要 arXiv:2502.16586v1 [cs.CV] 23 Feb 2025近期多模态大型语言模型(MLLMs)的出现为富文本图像理解(TIU)领域带来了新的维度,这些模型展现出令人印象深刻且鼓舞人心的性能。然而,它们的快速发展和广泛应用使得跟上最新进展的难度日益增加。为此,我们提出一项系统且全面的调查,以促进对TIU MLLMs的进一步研究。首先,我们概述了几乎所有TIU MLLMs的时间线、架构和流程。然后,我们回顾了所选模型在主流基准上的性能。最后,我们探讨了该领域的有前景的方向、挑战和局限性。 历史上,感知和理解任务是通过专门的模型或多阶段流水线分别处理的。近年来,视觉语言模型的进步已在视觉问答(VQA)范式内统一了这些任务,推动研究朝着端到端通用模型的发展。 1 简介 富含文本的图像在现实场景中发挥着关键作用,能够高效地传递复杂信息并提升可访问性(Biten等人,2019)。准确解读这些图像对于自动化信息提取、推进人工智能系统以及优化用户交互至关重要。为规范这一研究领域,我们将其定义为 图1展示了一个进化时间线,勾勒出统一文本丰富图像理解模型中的关键里程碑。该轨迹揭示了两个截然不同的时代:(a) LLM之前时期(2019- 2022年)以LayoutLM(Xu等人,2019)和Donut(Kim等人,2021)等专用架构为特征,这些架构采用了模态特定的预训练目标(如掩码语言建模、掩码图像建模等),并结合了OCR衍生监督(如文本识别、空间顺序恢复等)。虽然这些模型在受控环境下有效,但由于其任务特定的微调需求以及受限的跨模态交互机制,它们在开放域场景中的适应性有限。(b)后LLM时代(2023年至今)以LLM的日益普及为标志。一些研究提出了多模态大型语言模型(MLLM),将LLM与视觉编码器集成,通过统一的注意力机制联合处理视觉标记和语言元素,实现端到端的序列建模。 所有 TIU MLLMs 在四个维度:模型架构(第二节)、训练流程(第三节)、数据集与基准(第四节)、挑战与趋势(第五节)。这对推动该领域的发展具有学术和实践意义。 2 模型架构 TIU MLLM方法通常利用预训练的通用视觉基础模型来提取鲁棒的视觉特征,或采用OCR引擎从图像中捕获文本和布局信息。然后使用模态连接器将这些视觉特征与来自LLM的语言特征的语义空间进行对齐。最后,将组合的视觉-语言特征输入LLM,该模型利用其强大的理解能力进行语义推理,以生成最终答案。如图2所示,TIU MLLM框架可以抽象为三个核心组件:视觉编码器、模态连接器和LLM解码器。 该范式演进解决了早期方法的两项关键局限性。首先,新兴的MLLM框架通过同质化token表示消除了模态特定的归纳偏差,从而实现了无缝的多任务集成。其次,LLM中编码的语言先验能力赋予了前所未有的零样本泛化能力,并允许直接应用于多样化任务而无需特定任务的调优。 2.1 视觉编码器 视觉编码器·负责将输入图像转换为特征表示V = F(·)(I),如图3所示。如图3所示,这些编码器可分为无OCR、基于OCR或混合方法三类。 尽管这些多模态大型语言模型展示了令人印象深刻且鼓舞人心的成果,但它们的快速演进和广泛采纳使得追踪前沿进展日益具有挑战性。因此,需要针对文档进行系统综述,以总结和分析这些方法。然而,现有的关于富含文本的图像理解的调查往往存在视野狭窄的问题:它们要么分析特定领域的场景(例如表格和图表(Huang等人,2024a)、图表(Huang等人,2024b;Al-Shetairy等人,2024)、表单(Abdallah等人,2024)),要么强调统一的深度学习框架(Subramani等人;Ding等人,2024)。 无OCR编码器被广泛用于提取高级视觉特征,有效捕捉物体、场景和纹理等关键信息。常用的无OCR编码器包括:CLIP ConvNeXt (1) (Radford等人,2021年);(2) SAM (Woo等人,2023年);(3) (Kirillov等人,2023年);DINOv2 Swin-T (4) (Oquab等人,2023年);(5) (Liu InternViT等人,2021年);(6) (Chen等人,2024d)。 基于OCR的编码器通过直接输入的三种主要范式处理OCR输出中的文本内容和布局信息:(1)将原始OCR文本注入大型语言模型,但长序列会降低推理效率(He等人,2023b);交叉注意力(2)动态选择显著 我们的系统性调查通过提供对近...的首次全面分析来弥补这一空白。 图3:现代大语言模型的进化树追踪了近年来语言模型的发展,并突出了其中一些最知名模型。根据编码器的分类,蓝色分支是无OCR的,粉色分支是基于OCR的,绿色分支是编码器混合。 em- 中心作品还提出了更有效和创新各种视角下的创新性情态连接词)或Lay- tives,例如标记压缩和标记缩减)用于构建OCR功能。前者侧重于减少数量输入到MLLM标记中的无损压缩数据混合编码器双无OCR处理:(1) 架构(例如,C面临可扩展性和效率方面的挑战。重新设计的Re- mPLUG-DocOwl 1.5 压缩方案,后者则解决了成本高昂的问题。通过LLM中的注意力机制提取内容(Wang等人。基于OCR:BLIP-2;布局LMv3混合:(1)双OCR-Fr,e(2)混合OCR-Fr 2023 e:CLIP+SA ee/基于OCR:C外部编码器);(3)采用专用模型,如BLIP-2(MLIP+布局LMv3 Li等人,2023年),DocFormerv2(Nacson等人,2024年),outLMv3(Yupan等人,2022年)等,在LLM集成前对文档结构进行处理(Tanaka等人,2024a;Luo等人,2024a;Fujitake,2024年)。 通过移除冗余和不重要的策略来处理TIU的代币标记表示,例如背景标记。任务复杂度通过两种主要的配置。 LIP+SAM)结合互补的宏观特征和局部细节(Wei等人,2024年);混合无OCR/基于OCR系统(例如,要求多模态推理(Liao等人,2024a)。 令牌压缩 1) 像素洗牌(Chen等人,2024c)通过将空间维度重新分配到s×s×sξ:−→h w×w×(s );(2)(联合捕捉高分辨率特征图中全局语义元素的suual编码器 (h C×××C) R s s,来重新排列h、w,形成更低分辨率的特征图h、w。 CLIP+LayoutLMv3) 协同利用了视觉特征图的深度(通道)。这里,带文本布局理解的牵引,证明表示压缩率。我们总结了特别适用于文档级任务,重新处理为 令牌减少器 关于查询(一组可训练的向量)的信息和语言。或模型本身的关键特性)和]属于由不同模态产生的图像特征,即关键点。因此,为了弥合视觉编码器。我们将该过程总结为它们之间的差距,并创建统一序列1) 跨注意力(Alayrac等人,2022年;Li等人,2023年;Chen等人,2024d;Dai等人,2023年)运算:h×w×C → q×D。 2.2 情态连接词 V = [v₁, v₂, ..., v] 嵌入,T = [t₁,t₂, ..., t] 言嵌入,其中 ξ: V →T 是一种在文献中用于将视觉特征转换为可由大型语言模型(LLMs)处理的语言表示的模态连接器。 2) H-Reducer(Hu等人,2024a)引入了×4卷积层来减少视觉特征,ξ:该过程为 −→ h h C × w w × × × D R R 4 。 通常使用,这是 视觉上,水平文本在自然界中广泛存在。 代币。我们回顾了先前使用的策略场景,并检查了其语义连贯性。我们总结了 3) C/D-抽象(Cha等人,2024)采用Con-分别使用简单的线性投影器、卷积和可变形注意力来实现具体而言,模态连接器可以容易地实现,即 m= n 多层感知(MLP)。 但需同时实现灵活性和本地化保留。 表1:代表性主流多模态大语言模型(MLLM)的汇总,包括模型架构、训练流程以及TIU四个最流行基准测试上的得分。“私有”表示该MLLM使用专有大型模型。“†”表示该结果是通过下载官方开源模型并在本地进行测试获得的。 图像特征方面,支持中英双语图像LLM的相似性。4) 注意力池化(Liu等人,2024e;Huang等人,2024c)识别重要标记并移除冗余标记。通常使用评估冗余标记(Liu等人,2024e)。这是最特别的一个。 不同参数规模(例如,7B、13B、34B)。Qwen系列。Qwen(Bai等人,2023a;Yang等人,2024a),由阿里巴巴开发,是一种多语言模型。 该方法选择高度独特的开源大型语言模型,该模型基于LLaMA构建。缺乏紧密相似的对应物。由来自各机构的研发团队开发出的平均池化。维库纳系列。维库纳(郑等,2023)是一个由包括加州大学伯克利分校、卡内基梅隆大学和斯坦福大学等在内的团队开发的开源大型语言模型。 InternLM系列。InternLM(Cai等人,2024)是一个开源的大型语言模型系列, 2.3 大语言模型解码器 由上海人工智能实验室提供,对齐后的特征被输入到LLM解码器中随着最新版本 InternLM 2.5 的推出,提供参数调整功能,以及用于推理的语言嵌入。1.8B、7B 和 20B 的模型参数规模。我们在 MLLM 中列出了常用的 LLM。 LLaMA系列。LLaMA(Touvron等人,2023a,b;Dubey等人,2024)是一个开源的大型...系列。 3 培训流程 MA IA);2)指令对齐();和3)由Meta开发的语言模型,旨在支持TIU的MLLM训练流程可以被...倡导开放与创新,人工智能发展分为三个主要阶段:1)模态对齐生成技术,LLaMA系列包含模型 1) 图表解析。图表类型包括柱状图(垂直和水平)、折线图、散点图和饼图。图表作为表格的视觉表现形式,而按阅读顺序组织文本无法捕捉其结构。为了保留其数学特性,研究人员通常将图表转换为表格。该过程涉及将图表分解为x轴/ y轴及其对应值,这些值可以表示为Markdown、CSV格式,甚至可以转换为Python代码。这种方法使模型能够更好地理解图表的特定含义。 偏好对齐 (PA) 3.1 模态对齐 在此阶段,以往研究通常使用传统OCR任务(Guan等人,2024b,2023b)的OCR数据对MLLM进行预训练,旨在弥合模态差距。通用对齐方法可分为三类:识别、定位和解析。 阅读全文。UReader(Y