您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [IBM]:SPARC:用于VLM测试时间缩放的分离感知和推理电路 - 发现报告

SPARC:用于VLM测试时间缩放的分离感知和推理电路

2026-07-06 IBM 王擦
报告封面

尼科洛·阿沃加罗 * 1 2 尼亚尼卡·德班纳特 * 1 2 李米 1 托马斯·弗里克 2 王俊岭 1 贺泽雪 3 华hang3 康拉德·辛德勒 1 马蒂亚·里戈蒂 2 尽管最近取得了成功,但在推理时动态扩展令牌预算的测试时扩展对于视觉语言模型(VLMs)来说仍然很脆弱。非结构化的视觉推理链将感知和推理交织在一起,导致长而混乱的上下文,其中小的感知错误可能会级联成完全错误的答案。推理还需要昂贵的强化学习,并使用手工制作的奖励。在这里,我们引入了SPARC(分离感知和推理电路),这是一个模块化框架,明确地将视觉感知与推理分离。受大脑中感觉至认知处理的启发,SPARC实现了一个两阶段管道,其中模型首先执行显式视觉搜索以定位与问题相关的区域,然后在这些区域上条件其推理以生成最终答案。这种分离使得能够进行独立的测试时扩展,并具有非对称计算分配(例如,在分布偏移下优先考虑感知处理),并支持选择性优化(例如,当感知阶段是端到端性能的瓶颈时,仅改进感知阶段)。它还通过在较低图像分辨率下运行全局搜索,并将高分辨率处理仅分配给选定区域来适应压缩的上下文,从而减少视觉令牌计数和计算。SPARC在具有挑战性的视觉推理任务中优于模块化基线和强大的视觉定位方法,例如在∗VQA基准上将Qwen3VL 4B V提高了6.7分,并在具有×较低令牌预算的200个OOD设置中超过了“用图像思考”4.6分。 多模态视觉语言模型(VLMs)已成为视觉推理与感知的事实标准(Li等人,2025)。VLMs是一种结合视觉和文本输入的架构。通过将视觉主干与大型语言模型(LLM)对齐(Huang等人,2023),它们将LLMs令人印象深刻的自然语言处理能力扩展到视觉领域(Alayrac等人,2022;Chen等人,2023b;Hua等人,2025;Li等人,2023;Chen等人,2023a;Liu等人,2023;Zhu等人,2024;Peng等人,2024;Achiam等人,2023;Karlinsky等人,2025)。VLMs从LLMs继承的能力之一是思维链(CoT)推理(Wei等人,2022),这是一种在测试时通过逐步迭代生成输出的计算机制,可通过强化学习进行优化,并由ChatGPT-o1(OpenAI,2024)和DeepSeek-R1(Guo等人,2025)等模型推广普及。像ViGoRL(Sarch等人,2025)和Deep-Eyes(Zheng等人,2026)这样的工作表明,通过将纯粹的文本CoT推理与图像内容交替进行,获得的多模态思维链推理,可以通过一个调用适当图像分析工具的多轮工作流程,明确地扎根于图像中的相关视觉证据。在这种所谓的“图像思考”范式(首次在OpenAI ChatGPT-o3报告中提出,OpenAI研究,2025)中,模型在推理步骤和感知动作(如在图像中选择感兴趣区域)之间交替进行。这种扎根的多模态CoTs在视觉推理任务中可以显著提高性能,尤其是在高分辨率感知方面,此时必须反复将注意力集中在微小但决定性的图像细节上。 “以图像思考”及多模态协同推理(CoT)的核心问题在于,其学习过程比标准的纯文本推理要复杂得多:大语言模型(LLM)必须具备在上下文窗口内管理多轮对话和工具调用的能力,而这些对话和调用会反复混合视觉信息和推理标记(Sarch 等人,2025;Su 等人,2025a;Zheng 等人,2026;Kumar 等人,2025)。这不仅计算成本高昂,而且更脆弱,特别是对于较小的模型,当面对长标记序列时,其性能会迅速下降。 图1.SPARC框架概述。我们将VLM推理过程解耦为两个不同的功能电路。第一阶段(感知):"what"和"where"电路执行隐式相关性检测(IRD),以图像和问题为输入,输出相关裁剪坐标(例如,定位女人的耳朵)。第二阶段(推理):"前额叶皮层电路"通过对第一阶段识别的高分辨率裁剪进行推理来合成思维链(CoT),并输出最终答案("蓝色")。这种分离使得能够独立优化,并实现稳健、高效的测试时扩展。 对于视觉信息密集的语境和推理链的延长(Tian等人,2026年),这会加剧视觉语言模型在处理精细视觉细节方面的困难(Rahmanzadehgervi等人,2024年),并使其倾向于陷入由偏见驱动的“幻象推理”(Vo等人,2026年;Asadi等人,2026年)。此外,单一化的方法缺乏灵活性,并且没有机制来根据视觉任务的难度调整分配的计算资源:何时终止响应则由大型语言模型决定。 与“用图像思考”的本族语者相比,我们的结果更优;此外,我们还展示了它具有许多有趣的特性。 首先,当使用包含高效初始IRD步骤的两步流程时,可以在测试时独立于推理来扩展感知能力。例如,通过对IRD KV步骤的八次展开应用自洽性,并使用共享缓存,仅会生成少量额外的文本标记和一次额外的裁剪,但可将整个流程的性能提升高达9.3%。其次,这两步可以单独训练,而不会遗忘模型的通用预训练能力。例如,在为某些技术领域的特定感知需求进行训练时,不会丢失推理和生成CoT的能力。第三,针对IRD任务的专门训练在数据和训练时间方面都极为高效,因为只需为裁剪坐标展开少量标记,而无需在每次迭代中都经历冗长的多模态多轮推理链。 在此,我们提出了一种新的、更高效的针对视觉语言模型(VLMs)的测试时缩放策略,该策略受到上下文工程原理(Mei等人,2025)的启发。这些原理认为,以非结构化的方式运行思维链(CoTs)(在我们的案例中,将感知和推理标记交织在一起),会阻碍上下文的有效组织,并因此损害任务性能。 我们的架构借鉴了系统视觉神经科学,特别是生物大脑的分层信息处理架构,其中早期视觉区域首先提取低级特征,这些特征通过并行的“什么”和“哪里”视觉通路得到精炼(Mishkin等人,1983;Kravitz等人,2011)。然后这些信息在负责整合感觉输入和情境信息、并支持我们灵活的目标导向思维、学习和行为的额前叶皮层(Rigotti等人,2013;Tye等人,2024)的高维编码中汇聚和混合,该皮层区域被认为负责这些功能(Miller & Cohen,2001;Sung等人,2025)。 总而言之,我们的贡献是: 我们介绍SPARC,这是一种有效的提示方案,它能够在零样本模式下,以极小的计算开销,实现感知任务在测试时的可靠扩展。 我们证明了SPARC能够实现感知与推理之间非对称的计算分配,从而允许一种更具针对性的自洽性机制,其扩展性优于朴素集成。 基于此观点,我们提出一个如图1所示的两阶段流程。给定一个视觉问题和其相关答案,我们不直接提示模型返回答案,而是要求它找出相关的图像内容。然后,使用由这种隐式相关性检测(IRD)检测到的图像裁剪来重新提示模型,根据相关的图像区域对实际问题给出答案。这种提示策略本身,结果表明能带来更好的 我们证明了将视觉推理解耦为独立的感知和推理阶段,能够使感知模型的训练高效化,同时不降低推理模型原有的能力。 视觉-语言模型的测试时缩放。越来越多的研究通过“用图像思考”(Su等人,2025b)将“R1风格”的测试时缩放应用于视觉-语言模型,该方法将中间视觉操作(例如,缩放、裁剪、指向)与文本思维链交织和纠缠在一起。该范式主要通过激励显式视觉推理的强化学习框架来开发。例如,Point-RFT(Ni等人,2025)和ViGoRL(Sarch等人,2025)利用强化微调来使推理轨迹与精确的 grounding 空间参考对齐。类似地,DeepEyes(Zheng等人,2026)和Pixel Reasoner(Su等人,2025a)采用好奇心驱动或特定的奖励结构来鼓励模型在推理过程中积极查询视觉数据,其中一些工作(如Kumar等人,2025)主要关注效率。除了静态图像之外,Video-R4(Tang等人,2025)将这一概念扩展到视频理解。 2. 相关工作 视觉-语言模型与定位。近期视觉-语言模型(VLMs)的进展主要集中于通过视觉编码器(例如CLIP(Radford等人,2021年)、SigLIP(翟等人,2023年)等)连接到大型语言模型(LLMs)主干,赋予其视觉感知能力(刘等人,2023年;李等人,2024年;白等人,2023年)。像LLaVA-OneVision-1.5(安等人,2025年)、MM1(麦金齐等人,2024年)和Qwen3-VL(白等人,2025年)这样的现代架构扩展了这一范式,提升了分辨率处理和多图像推理能力。虽然大多数VLMs仅输出文本,但一个关键的演进是细粒度视觉定位的集成,使模型能够伴随文本输出空间坐标(边界框或点)。Kosmos-2(彭等人,2024年)、Qwen3-VL和PaliGemma(贝耶等人,2024年)等模型原生支持这种定位能力,将坐标视为文本或特殊标记。较新的工作如GLaMM(拉斯希德等人,2024年)和Molmo2(克拉克等人,2026年)通过将分割或基于点的定位与推理交错进行,进一步精炼了这一方法,建立了一个强大的范式,其中精确的空间定位是生成过程固有的(赵等人,2025年;王等人,2025c),实现了令人惊讶的性能水平(阿沃加罗等人,2025年),有时甚至源于注意力图(张等人,2025a),尽管在极端细粒度局部定位方面存在局限(张等人,2026年)。 3. 测试时感知尺度调整 精细的视觉感知是众多应用的基础,这些应用范围广泛,从文档理解、户外机器人到卫星图像分析。在推理过程中允许模型在给出最终答案前生成额外标记,使其能够参考更广泛的上下文信息进行推理,这一机制已被证明能够持续提升预测准确性和鲁棒性(Wei等人,2022;OpenAI,2024;Guo等人,2025)。在本工作中,我们关注视觉语言模型(VLMs)的感知能力。我们的目标是以高效且鲁棒的方式提升模型在测试时对任务相关视觉输入的处理能力。 大语言模型的测试时缩放。测试时缩放范式——允许自回归模型在输出最终答案之前生成额外的中间标记——已成为一种强大的、无需训练的性能提升方法。思维链(CoT)(Wei等人,2022)和自洽性(Wang等人,2023)等基础技术表明,线性推理轨迹显著提升了问题解决能力。后续工作将其扩展到非线性结构,如思维树(ToT)(Yao等人,2023)和思维图(GoT)(Besta等人,2024),这些结构能够更审慎地探索解空间。最近,这种强大的推理能力通过强后训练技术直接嵌入模型中。像OpenAI o1(OpenAI,2024)和DeepSeek-R1(Guo等人,2025)这样的系统利用具有稀疏奖励的强化学习(RL)来鼓励模型自主验证和优化其内部思维链。此外,最近的研究表明,这种复杂的推理模式也可以以无训练的方式诱导,例如通过无训练的组相对策略优化(GRPO)(Cai等人,2025),或通过外部认知工具来激发推理(Ebouky等人,2025)。 直观上,更精细的图像理解需要更丰富的视觉表示。我们认为这直接转化为测试时图像token数量的增加。这种直觉与近来流行的“用图像思考”的VLM测试时扩展方法一致。在该框架下,模型生成包含放大操作的扩展推理轨迹,即模型调用工具以检索更高分辨率的图像裁剪。 虽然我们认同放大图像中可能对任务重要的位置这一高层级概念,但我们认为,对于主要涉及感知的任务而言,冗长的中间文本生成和复杂的多轮处理是多余的,甚至可能适得其反。这种程序产生的开放式追踪对实际感知任务几乎没有益处;相反,它们违背了提倡采用结构化和模块化组合(Mei等人,2025)的上下文工程原则,并可能促进产生过长的追踪,从而导致幻觉(Diao等人,2026)。相反,我们提出一种 我们通过受控的空间扰动系统性地调节作物的可用性。对于每个目标对象,我们生成一个与真实边界框高度和宽度相同的作物,但将其中心相对于真实位置平移距离r。通过逐步将r从边界框的半对角线长度减少至零,我们生成一组与真实作物部分重叠的图像,并使用这些图像作为视觉提示。图2展示了模型的问答准确率与重叠度的关系。我们通过将图像缩放到更