本文构建了一种名为T2RL的两阶段量化选股框架,旨在解决传统深度学习模型仅聚焦于收益率预测而难以实现组合全局优化的问题。T2RL框架将Transformer模型与强化学习算法有机结合,分为深度学习因子挖掘和强化学习组合权重优化两个阶段。
阶段一:深度学习因子挖掘
- 构建了融合Transformer与Actor-Critic机制的因子挖掘模型TFAC。
- TFAC利用Transformer的自注意力机制提取量价时序数据中的深度表征,并通过AC框架引入方向准确奖励函数,使模型同样注重收益符号的正确性。
- 回测显示TFAC因子RankIC为0.1119,多头组合年化收益率33.61%,优于传统Transformer模型,且大多数年份跑赢基准。
阶段二:强化学习组合权重优化
- 构建了基于Transformer的Soft Actor-Critic组合优化模型TFSAC。
- TFSAC首先根据TFAC因子筛选出排名前N的股票构成候选池,将动作空间压缩至可控维度;随后在连续动作空间中学习权重分配策略,以对数收益与方差构建奖励函数,平衡收益与风险。
- 回测显示,单日调仓下T2RL组合在全A范围内相对万得全A等权年化超额收益率50.36%,相对因子多头组合年化超额收益率31.06%;在2日及5日调仓频率下,组合年化收益率相对因子多头组合年化超额收益率分别为24.68%及6.03%。
- 不同调仓频次下策略均能稳定跑赢基准和TFAC等权组合,且在因子短期失效的时期,T2RL仍可跑赢全A指数及多头等权组合。
指数成分股组合测试
- 在沪深300成分股内,TFAC因子的RankIC为6.35%,Top10%多头组合相对沪深300年化超额8.55%。T2RLHS300组合在单日调仓下年化收益率42.64%,相对沪深300年化超额收益率30.87%,相对因子多头等权组合超额20.43%;在2日及5日调仓频率下,组合相对沪深300超额收益分别为25.74%和11.91%,且同样可以跑赢因子多头等权组合。
- 在中证1000成分股内,TFAC因子的RankIC为9.17%,Top10%多头组合相对中证1000年化超额11.85%。T2RLZZ1000组合在单日调仓下相对中证1000年化超额收益率48.19%,相对因子多头组合年化超额收益率32.21%。在2日及5日调仓频率下相对中证1000年化超额收益率分别为42.88%和27.35%。相对因子多头等权组合年化超额收益率分别为27.47%以及13.62%。
总结与展望
- T2RL框架通过融合Transformer模型和强化学习算法,实现了从个股预测到投资组合构建的完整闭环,提升了策略的收益能力和风险控制水平。
- 未来可从探索更高效的状态表征学习方法、引入更复杂的逻辑关系、研究多时间尺度组合优化算法、将框架扩展至多市场、多资产类别配置场景等方向深入拓展。