核心观点与挑战
随着数据类型的多样化(结构化数据库、非结构化文本和多媒体),传统搜索和检索方法难以应对海量复杂数据。生成式AI(Gen AI)通过语言嵌入和来源 grounding 技术,优化检索策略,提升性能、速度和可扩展性,解决数据提取挑战。当前挑战包括:数据提取困难(非结构化、不一致、大规模数据)、LLM 可能产生幻觉、成本和速度限制导致可扩展性有限、现成 LLM 和搜索引擎难以按需配置。
技术方案与流程
EY 与 Elastic 合作,利用生成式AI 和检索策略构建端到端解决方案。该方案采用语言嵌入模型(如 Elastic Learned Sparse EncodeR,ELSER)将自然语言转换为向量,通过向量存储处理多种数据类型,结合相似性搜索(如 k-NearestNeighbors,kNN)和排名模型(如 Reciprocal Rank Fusion,RRF)提升检索精度。流程包括嵌入模型、向量存储、相似性搜索和排名模型,形成高效、可扩展的检索生态系统。
应用案例与效果
-
ESG 数据提取
从银行年度 ESG 报告中提取数据,目标实现高精度、高速度和可扩展性。EY 解决方案结合 Elastic RAG 技术,通过 PDF 分析、索引和分块,精准提取 Scope 1、2、3 排放等关键变量。与 Naive RAG 对比,Elastic RAG 在上下文相关性和准确性上均显著提升(五家加拿大银行数据支持),且响应速度提高三倍。多种检索方法(如 Elastic RAG + 关键词过滤、混合检索)保持高精度,证明系统鲁棒性和可扩展性。
-
财务数据提取
从季度报告中提取 40 余项财务变量,解决 LLM 处理表格数据的难题。EY 采用链式思维和验证流程,结合向量搜索与 BM25 算法,提升数据提取精度。2023 年 Q1 补充财务报告数据显示,准确率提升近 24%,优于传统 RAG 方法,推动财务数据分析效率和质量升级。
研究结论
生成式AI 通过与先进搜索技术的融合,显著提升金融服务业数据提取的准确性、速度和可扩展性。EY 与 Elastic 的解决方案不仅解决当前数据挑战,还为未来 ESG 和财务数据分析设定新标准,强调 AI 驱动策略在数据价值挖掘中的重要性。