核心观点
本文介绍了基于 Qwen3-VL 基础模型的 Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型系列,旨在解决多模态检索问题。该系列模型能够将文本、图像、文档图像和视频等多种模态信息映射到统一的表示空间,实现高精度的多模态搜索。
模型架构
- 嵌入模型:采用双编码器架构,将多模态输入转换为密集向量表示,并使用余弦相似度作为相关性度量。
- 重排序模型:采用交叉编码器架构,通过交叉注意力机制对查询-文档对进行细粒度的相关性估计。
数据集
- 数据集格式:包含指令、查询、文档和相关性标签四个部分。
- 数据合成:通过种子池构建和 Qwen3-VL-32B 模型进行多模态和多任务标注,涵盖图像分类、图像问答、图像检索、视频分类、视频问答、视频检索和时刻检索等任务。
- 正向精炼和硬负样本挖掘:通过召回和相关性过滤,提高正样本质量和识别有效硬负样本。
训练策略
- 多阶段训练:
- 阶段 1:对比预训练:使用大规模多模态数据进行对比学习,建立相关性理解基础。
- 阶段 2:多任务对比学习和监督微调:使用高质量数据集进行多任务对比学习和监督微调,提高相关性评分精度。
- 阶段 3:蒸馏和模型合并:从重排序模型中蒸馏相关性区分知识,并通过模型合并优化性能。
- 高效推理技术:
- Matryoshka 表示学习:支持灵活的嵌入维度,降低存储和计算成本。
- 量化感知训练:支持多种数值精度,提高推理效率。
训练目标
- 嵌入模型:使用 InfoNCE 损失函数进行检索数据、分类数据和语义文本相似度数据的训练,并使用分布匹配目标进行知识蒸馏。
- 重排序模型:将重排序问题视为二元分类问题,使用交叉熵损失函数进行训练。
评估
- 多模态基准:在 MMEB-v2 基准测试中,Qwen3-VL-Embedding-8B 实现了 77.8 的平均分数,排名第一。
- 视觉文档基准:在 JinaVDR 和 Vidore-v33 基准测试中,性能与 ColPali 风格模型相当,而重排序模型性能显著优于 ColPali 模型。
- 文本基准:在 MMTEB 基准测试中,Qwen3-VL-Embedding-8B 实现了 67.9 的平均分数,与同等规模的纯文本嵌入模型性能相当。
- 重排序模型评估:在 MMEB-v2、MMTEB、JinaVDR 和 Vidore-v33 基准测试中,Qwen3-VL-Reranker 模型性能优于基础嵌入模型和基线重排序模型。
分析
- Matryoshka 表示学习和嵌入量化:在文本检索和跨模态文本到图像检索任务中,降低嵌入维度和量化精度可以有效降低存储和检索延迟,同时保持较高的检索性能。
- 空间和时间粒度:随着资源消耗的增加,模型性能有所提升,但存在边际效益递减的现象。
- 训练阶段性能:通过从重排序模型中蒸馏知识,嵌入模型的检索任务性能显著提升,最终模型合并阶段实现了所有评估任务的性能优化。
结论
Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型系列在多模态检索领域取得了突破性进展,实现了优异的性能和高效的推理能力。未来研究方向包括支持更多模态、开发更高效的训练范式、增强组合推理能力和建立更全面的评估协议。