发布时间:2026-08-18 一、核心要点 1. 本次分享为量化选股领域主流的机器学习及神经网络选股方法方法论,涵盖5个核心流程,该方法在公募、私募、保险资管中广泛应用,可用于指数增强、多因子策略。 2. 机器学习选股方法核心缺陷为几乎无解释性,类似GPT等AI模型,难以明确推导逻辑,但已成为行业趋势。 二、模型选择与对比 1. 主流选股模型分为两类:一类是树模型(发展超10年,含随机森林、GBDT等进阶合成方法,具备一定可解释性,通过迭代划分股票特征节点排序选股,需防范过拟合,通过样本内、外划分检验);另一类是神经网络(主流如Transformer、RNN、TCN等,擅长长时序信息处理,但量化选股仅需回看100-120天数据)。 2. 模型适配特征存在差异:手工量价因子下两类模型效果相近;基本面因子(低、低频)下树模型表现更优,神经网络因无法处理低频数据效果较差;原始量价因子下神经网络擅长加工提取有效信息,表现较好。 三、关键流程与细节 1. 特征数据准备:包括经典158个量价阿尔法因子、团队积累的基本面因子(估值、成长、质量等)、原始量价因子。 2. 特征筛选:采用SHAP方法,通过特征子集含、不含时模型差异衡量特征重要性;2026年上半年电子抱团行情下,主流做法改为训练阶段保留原始阿尔法信号,不再强行中性化。 3. 特征处理:整体标准化优于截面标准化,可避免模型丢失时序信息,需通过训练集计算均值标准差,防范未来数据泄露。 4. 损失函数:采用排序学习损失(类抖音、搜索引擎算法逻辑),聚焦股票选股排序任务,DCG损失函数可重点优化多头前N只股票排序准确性,提升多头超额表现,优于传统MSE损失。 5. 预测目标:优先采用截面上标准化处理(去除贝塔,仅保留相对收益排序),优于原始收益率;预测周期10-40天效果相近,可通过多周期模型等权合成控制换手,降低资金成本与手续费损耗。四、指数增强策略表现与市场适配性 1. 沪深300指增:月度调仓、双边千三费率下,样本外超额收益约10%,超额回撤约5%,信息比率约2.23;但在政策突然调整、行业抱团(如2024年9月、2025年7月半导体/电子抱团)时,因行业、个股偏离约束存在天然劣势,跑输指数。 2. 中证500指增:超额收益约8%,超额回撤约10%,实际操作难度高于沪深300,因子拥挤度较高。 3. 中证1000指增:中小票误定价机会多,表现相对更优,更适合机器学习模型选股。