传统的债券违约模型如Altman Z-score和Merton模型存在局限性,如财务指标有限、参数依赖大等。机器学习在债券违约风险评估中具有优势,能自动化数据分析、处理大规模数据、适应市场变化,提高预测准确性。
研究采用2022Q1财报数据(训练集)和2024Q2财报数据(测试集),仅保留公司债和可转债,选取财务、债券本体、股票交易三大类指标。针对数据不平衡问题,采用欠采样策略平衡数据分布,保留重要异质性信息。
研究比较了逻辑回归、随机森林、支持向量机、XGBoost和LightGBM五个模型,发现支持向量机因未来函数问题导致召回率提高,但综合考虑后选择随机森林作为最终模型。随机森林在AUC和召回率上表现最佳,AUC达到0.90,召回率达到0.84。
特征重要性分析显示,上市公司财务指标对模型预测贡献最大,占比58.92%。使用随机森林对最新一期(2024年11月1日至2024年12月20日)信用风险样本进行预测,对已发生信用风险事件预测概率均大于50%,调整概率均大于50%。预测结果显示11支可转债信用风险调整概率超过50%。
风险提示:数据选取可能存在偏差,特征选取存在主观性,数据不平衡采样可能导致信息丢失,历史数据无法完全预测未来,模型存在失效可能性。