主要观点:
- 混合算法显著提升聚类稳定性与鲁棒性:K-Means++MD混合算法通过结合K-Means++初始化和马氏距离计算,有效解决了传统K均值对初始质心敏感的局限性。实证表明,该算法将戴维森堡丁指数(DBI)降至1.86,特征标准差锐减至0.03,显著优于基准方法(如K-Means MD的DBI为2.06),确保了聚类结果在投资组合构建中的可重复性与可靠性。
- 特征复杂度与分类效果存在权衡关系:
- 研究通过对比不同财务指标组合发现,仅包含市净率(P/B)和市盈率(P/E)的简约特征集产生最优聚类效果(DBI=0.93,轮廓系数=0.32),而引入增长类指标(如动量、季度增长率)反而降低分类清晰度(如“增长”组合DBI升至1.68)。这表明价值-成长分类应聚焦核心估值比率,避免冗余指标引入噪声。
- 其他相关研究包括《所有日子并不平等:通过加权历史收益理解动量效应》、《重审股票投资组合中的持股数量》、《财报季“信息洪流”下的反常行为:投资者如何从细节转向宏观?》、《海外主动基金业绩基准的设置与纠偏》、《因子溢价如何随时间变化?——来自一个世纪数据的证据》。
- 纯化组合凸显风格区分与经济意义:基于轮廓系数和距离比率构建的“纯价值”与“纯成长”组合,在2008–2023年间展现出显著的风险调整后超额收益:纯成长组合夏普比率达0.66,最大回撤仅-32.4%,显著优于基准指数。此类组合在行业分布上(如金融股主导价值组合、科技股主导成长组合)亦符合传统风格定义,验证了聚类结果的经济可解释性。
- 其他相关研究包括《因子溢价如何随时间变化?——来自一个世纪数据的证据》、《重审股票投资组合中的持股数量》、《财报季“信息洪流”下的反常行为:投资者如何从细节转向宏观?》、《海外主动基金业绩基准的设置与纠偏》。
- 风险提示:文献结论基于历史数据与海外文献进行总结;不构成任何投资建议。
核心内容摘选自Marc Weibel和Lionel Nyffeler于2025年在SSRN上发表的文章《EnhancingValue-GrowthStockClassificationUsingK-MeansClusteringwithMahalanobisDistance》。