摘要
核心观点: 随着支付欺诈率上升和生成式AI工具的普及,对创新欺诈检测研究的需要日益增长。然而,公开可用支付交易数据的匮乏限制了此类研究的速度、多样性和可重复性。本文介绍了一种名为CardSim的贝叶斯模拟器,用于生成支付卡交易数据,以支持欺诈检测研究。
关键数据:
- 美国支付卡欺诈率自COVID-19大流行以来显著增长,2023年信用卡和借记卡持有者遭遇欺诈的比例分别为11.5%和9.4%。
- 欺诈检测研究文献在过去十年中增长了316篇,但主要受限于公开数据的缺乏。
- 现有公开数据集往往过时、样本量小且高度掩盖,难以全面评估机器学习方法。
研究方法: CardSim通过三个阶段生成模拟数据:
- 制定付款人和收款人特征: 使用公开调查和经济学数据,如消费者支付选择日记(DCPC),生成付款人档案,并假设付款人与收款人的比例为10:1。
- 运行模拟实验: 模拟器确定每日付款数量,并生成五个交易属性:卡类型(借记卡或信用卡)、位置类型(面对面或远程)、金额、距离和时间。
- 分析实验结果: 利用贝叶斯定理生成欺诈标签,假设欺诈交易的平均金额是合法交易的2倍(借记卡)和1.45倍(信用卡)。
研究结论:
- CardSim生成的数据可以用于测试和评估欺诈检测的机器学习模型和工作流程。
- 示例结果表明,XGBoost和多层感知器(MLP)在精确率和召回率方面优于逻辑回归。
- 使用SHAP框架解释特征重要性,发现支付金额偏差是影响欺诈预测的最重要因素。
- 模拟器在处理类别不平衡问题方面具有挑战,但可以通过超参数调整和重采样方法进行改进。
研究意义: CardSim为欺诈检测研究提供了一个灵活、可扩展的平台,有助于推动该领域的创新和发展。