一、核心要点
- 本次汇报由长江证券研究所针对客户进行,内容聚焦于强化学习模型在中证1000指数择时中的应用,具体方法未通过PPT展示,由报告人现场讲解。
- 强化学习模型包含内外双循环及五个核心模块(智能体、行为、环境、状态、奖励)。外循环对应游戏过程,金融场景中因行为对市场状态影响隐匿而存在缺失;内循环对应奖励过程,类似有监督深度学习但包含行为变量。
- 本次报告采用深度Q网络(DQN)思路,以动作价值函数为核心,拟合最优动作价值函数,最终基于回报最大化反推出做多、平仓、持仓不变三类最优调仓动作。
- 报告对比了强化学习与深度学习的差异:强化学习加入动作变量、含内外双循环,提出多步DQN策略解决自举问题(降低估计有偏性),并验证其在指数择时上的样本内效果。
- 金融场景适配方面,当前市场仅存在环境对智能体的影响,无动作对环境的反馈,样本拓展有限,策略更适用于样本内验证,后续可探索个股CT相关方式。
- 策略逻辑基于金融量价指标预测未来收益率,核心通过多步策略优化样本选择,平衡蒙特卡罗(需全样本、运算量大)与自举(局部样本、存在有偏估计),降低有偏性。
- 择时效果方面,多步DQN对比单步DQN,在指数择时上提升样本内预测准确度,策略效果优于仅做多基准。
二、风险与关注
- 金融场景下强化学习应用的环境反馈缺失,导致样本拓展受限,当前策略仅适用于样本内验证。
- 多步DQN策略虽降低了自举的估计有偏性,但金融量价指标的选取与拟合质量可能直接影响择时效果。
三、后续关注点
- 进一步探索金融场景下强化学习的动作对环境反馈机制,拓展策略适用的样本范围。
- 将强化学习多步DQN策略拓展至个股CT相关领域,验证其在不同标的类型下的有效性。