组合图像检索(CIR)是一项新兴的计算机视觉任务,允许用户通过包含参考图像和修改文本的多模态查询来搜索目标图像。本文对 CIR 领域进行了全面综述,涵盖了 120 多篇出版物,并特别关注了监督式 CIR 和零样本 CIR 模型。
CIR 的核心挑战包括:
- 多模态查询融合:有效地结合参考图像和修改文本以准确理解用户搜索意图。
- 目标图像匹配:弥合多模态查询与目标图像之间的语义差距,并管理一对多的查询到目标匹配关系。
- 训练数据规模:解决训练数据不足的问题以提高模型的泛化能力。
本文的主要贡献:
- 细粒度分类系统:对现有的监督式 CIR 和零样本 CIR 模型进行了分类。
- 相关任务方法:简要讨论了与 CIR 密切相关的任务方法,如基于属性的 CIR 和基于对话的 CIR。
- 基准数据集:总结了用于评估的基准数据集,并通过跨多个数据集的实验结果对比,分析了现有的监督式和零样本 CIR 方法。
- 未来方向:提出了该领域的有前景的未来方向,为对该领域感兴趣并希望进一步探索的研究者提供实用见解。
CIR 方法的主要类别:
- 监督式 CIR:依赖于标记训练三元组(<参考图像,修改文本,目标图像>)来训练模型。
- 特征提取:常用传统编码器(如 CNN 和 RNN)或基于视觉-语言预训练(VLP)模型的编码器(如 CLIP 和 BLIP)。
- 图像-文本融合:包括显式组合、神经网络型和基于原型图像生成型融合策略。
- 目标匹配:采用基本度量学习、图像差异对齐、负样本挖掘、不确定性建模和重新排序等策略。
- 数据增强:利用大型语言模型(LLM)或图像替换等技术来扩充数据集。
- 零样本 CIR:无需标记训练三元组,利用大规模、易于访问的数据进行预训练。
- 基于文本反转:将参考图像嵌入映射到文本标记表示中,形成统一查询。
- 基于伪三元组:自动生成伪三元组数据来训练模型。
- 无需训练:利用现有模型(如 LLM)直接处理 CIR 任务。
研究结论:
- 基于 VLP 编码器的方法通常比传统编码器方法表现更好。
- 多种图像-文本融合策略已展现出强大的性能,但找到一种普遍最优的融合策略仍具挑战性。
- 集成额外目标匹配技术或数据增强模块的模型始终表现出优于其原始版本的性能。
- 某些零样本方法产生的结果可与一些有监督方法相媲美,但构建高质量伪三元组仍然是一个重大挑战。
- CIR 相关任务仍不成熟,需要进一步细化以充分发挥每个具体子任务的独特属性。
未来研究方向:
- 构建具有多个真实目标图像的开放域 CIR 数据集,同时减轻假阴性的问题。
- 开发能够增强大型语言模型的编码能力,同时保留其原生推理能力的高级微调策略。
- 开发高效的重排序方法,并研究如何更好地整合重排序和检索阶段。
- 设计将深度学习与可解释组件相结合的混合模型,或利用事后解释技术来揭示决策过程。
- 开发能从训练数据中选择性利用有用信息并忽略噪声的适应性机制。
- 探究 CIR 中各元素之间的因果关系,以减轻文本查询在跨模态检索(CIR)背景下所产生的负面影响。
- 开发能够无缝整合多样化模态的复杂模型,从而丰富检索过程,提高在各种情境下结果的准确性和相关性。