核心观点
项目背景:随着电子商务的兴起,网络价格数据成为央行进行通胀预测和预警的重要信息来源。然而,这些数据缺乏标准化,难以直接用于经济分析。
项目目标:Project Spectrum 旨在利用人工智能技术自动对网络产品描述进行分类,以便更好地进行通胀预测和预警。
方法:项目探索了两种方法:直接使用大型语言模型(LLM)进行分类和基于文本嵌入的机器学习分类器进行分类。结果显示,基于文本嵌入的分类器在准确性和成本效益方面均优于直接使用 LLM 的方法。
关键数据:项目使用了欧洲央行每日价格数据集(DPD),其中包含约 3400 万个独特产品的每日价格观测值。参考数据集包含 3 万个手动标记的产品,测试数据集包含 3 万个产品。
研究结论:基于文本嵌入的分类器能够以较低的成本和时间实现与直接使用 LLM 相当的分类准确率,并且具有更高的可扩展性和可解释性。项目还开发了一个持续改进的流程,通过逐步扩大参考数据集来提高分类准确率。
关键数据
- DPD 数据集包含约 3400 万个独特产品的每日价格观测值。
- 参考数据集包含 3 万个手动标记的产品,测试数据集包含 3 万个产品。
- 项目覆盖了欧元区 CPI 花费约 50% 的商品类别。
研究结论
- 基于文本嵌入的分类器在准确性和成本效益方面均优于直接使用 LLM 的方法。
- 项目开发了一个持续改进的流程,通过逐步扩大参考数据集来提高分类准确率。
- 该方法能够将网络价格数据转化为可操作的经济信息,为央行制定货币政策提供支持。