谷歌于2026年3月11日发布首个原生多模态嵌入模型GeminiEmbedding2,该模型具备跨模态能力,可将文本(最长8192tokens)、图像(6张)、视频(120s)、音频、PDF文档(6页)统一映射到同一向量空间。
核心观点与关键数据
过去多模态模型主要提升单一模态理解与生成能力,而GeminiEmbedding2实现了原生跨模态能力,显著提升跨模态检索的召回率和准确率(如文字+图片搜索音频)。
应用领域与效果
- 多模态RAG:适用于办公、法律、医疗等领域,通过捕捉不同模态信息的复杂关联,提升企业对非结构化、跨模态数据的利用效率和检索能力,有效打通企业内跨模态数据孤岛。
- 语义搜索、情感分析、推荐系统:模型可应用于电商、营销(提升意图理解与推荐匹配能力)、客服(可直接处理音频数据)等领域,增强业务效果。
研究结论
GeminiEmbedding2的发布标志着跨模态检索能力的重大突破,为企业级数据治理和AI应用提供新工具,推动多模态技术在语义搜索、情感分析、推荐系统等领域的落地。
资料来源:谷歌官网。
(注:仅公开资料整理,不涉及研究观点和投资建议。)