项目背景与目标
精确及时的通胀预测对于有效的货币政策至关重要。随着消费者支出很大一部分转移到线上,电商平台的数据成为通货膨胀预测和定价分析的丰富来源。然而,网络抓取的数据没有标准化,提取可操作见解仍然是一项挑战。主要问题是按照国际分类标准对产品进行标记,例如根据目的的个别消费分类(COICOP)。为了利用个别价格信息进行通货膨胀分析,将每个产品映射到分类类别至关重要。
项目方法与数据
项目Spectrum利用文本嵌入和多语言能力的大型语言模型(LLMs),将原始、高容量、非结构化产品数据转换为标准化的、可获取的信息。通过自动化产品分类,项目光谱促进了高频、在线价格数据整合到通货膨胀预测和预测过程中。项目使用了欧洲中央银行的每日价格数据集(DPD),其中包含了34百万种独特产品的数十亿价格-产品每日观察数据。
方法比较与评估
项目探索了两种产品分类方法:
- 直接LLM提示:向大型语言模型提供产品描述和产品类别的定义,并提示它预测适当的类别。这种方法在规模上采用存在可扩展性的挑战。
- 基于嵌入的分类器:将产品描述转化为高维文本嵌入,然后使用经典机器学习算法将这些嵌入分类到产品类别。文本嵌入是许多自然语言处理应用所使用的AI基础技术。
评估结果显示,基于嵌入的分类器在准确性上与直接使用大型语言模型提示相当,同时大幅降低成本和数据处理时间。
初始部署与持续优化
除了对现有所有DPD进行分类外,该项目还开发了一种解决方案,作为生产线,可以对新上市的产品进行分类。分类准确率和覆盖面可以通过扩大参考数据集来进一步提高。项目光谱管道支持一个迭代的人机协同过程,逐步扩展参考和验证数据集,有选择性地关注代表性不足的产品类别。
结论与下一步行动
项目Spectrum证明了结合文本嵌入和基于机器学习的分类,为结构化这些高频、大规模在线价格数据集提供了一种有效的方法。基于嵌入的分类器已具备生产级规模,有望将数据丰富的优势转化为可执行的经济理解。下一步是对不同的数据集和语言进行解决方案的测试,并在ECOICOP子类级别构建CPI指数,并将它们与官方通货膨胀时间序列的“黄金标准”进行比较。