指导数据与人工智能领导者实现大规模生成式AI(Gen AI)的关键行动
强化数据质量和准备度
- 改善和扩展源头数据:确保从复杂数据类型获取更高质量和准确的数据,包括结构化和非结构化数据。通过知识图谱等工具捕捉实体间复杂关系,为大型语言模型(LLMs)及其下游数据集提供有意义的上下文。
- 处理不同数据类型和来源之间的关系:采用多模态模型解析不同文档格式中的复杂文档,如从非结构化文档提取表格数据。虽然这类模型正在变得更容易使用,但准确性问题仍需持续关注,并通过自动化评估方法、版本管理机制和数据相关性评分来增强输出准确性。
创造不可用数据
- 在数据难以获取的情况下生成数据:对于某些难以获取和处理的数据驱动型应用,数据工程师可以通过手动生成文件测试用例的有效性。然而,这种方法耗时且效率低下。相反,投资于生成合成数据作为测试数据或基于列描述和上下文产生新值的Gen AI工具,可以帮助创建统计上相似的数据集或对现有数据集进行修订。
加速构建可重用的数据产品
- 利用Gen AI加速数据产品的开发:通过更好的数据和新的Gen AI工具,企业能够加速数据产品的开发并改进输出结果。例如,某酒店公司通过自动生成端到端的数据转换管道(如PySpark)和详细记录所有复杂转换,将客户领域数据模型的创建速度提高了60%,同时将特征工程生产力提高了50%。
- 采取端到端的方法构建数据管道:转向全面构建数据管道的方法,通过自动化所有步骤,可以实现高达80%至90%的时间节省,并为特定用例提供增强的可扩展性。这包括在SQL或Python等语言中编写数据管道代码,以生成能够解决多个用例的整个模型。
提升一致性:优化协调和数据管理
- 确保数据质量:确保数据源可靠、易于理解和可用,对于长期构建数据资产的公司来说至关重要。通过使用各种代理(Gen AI应用程序)跨多个LLM分析遗留代码库并生成自然语言文本描述,可以改善组织对其代码库的理解,简化识别和删除冗余代码段的过程。通过优化数据流程的协调和管理,增强数据的一致性和可重复性。
这些策略旨在帮助数据和AI领导者从Gen AI试点项目过渡到规模化数据解决方案,通过改进数据质量、利用Gen AI生成数据和加速构建可重用的数据产品,以及提升数据管理的一致性,为企业实现数据驱动的未来奠定坚实基础。