您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:长江金工强化学习多步DQN中证1000择时策略汇报要点 - 发现报告

长江金工强化学习多步DQN中证1000择时策略汇报要点

2026-07-29 未知机构 顾小桶🙊
报告封面

发布时间:2026-07-29 一、核心要点 1. 本次为长江证券研究所针对客户的现场汇报,内容围绕强化学习模型应用于中证1000择时展开,未上传PPT,由报告人现场阐述。 2. 强化学习包含两个循环及五个核心模块,分别为智能体、行为、环境、状态、奖励;其外循环对应游戏过程,在金融场景中因行为对市场状态影响较隐性而存在缺失,内循环对应奖励过程,类似有监督深度学习,但多了行为变量。 3. 本次报告采用深度Q网络(DQN)思路,将动作价值函数作为核心,拟合最优动作价值函数,最终基于回报最大化反推出做多、平仓、持仓不变三类最优调仓动作。 4. 报告对比了强化学习与深度学习的区别,强化学习加入动作变量、含内外双循环,提出多步DQN策略以解决自举问题(降低估计有偏性),并验证其在指数择时上的样本内效果。 5. 金融场景适配方面,金融市场目前仅存在环境对智能体的影响,无动作对环境的反馈,样本拓展有限,该策略更适用于样本内验证,后续可探索个股CT相关方式。 6. 策略逻辑以金融量价指标为基础预测未来收益率,核心是通过多步策略优化样本选择,平衡蒙特卡罗(需全样本、运算量大)与自举(局部样本、存在有偏估计),降低有偏性。 7. 择时效果方面,多步DQN对比单步DQN,在指数择时上提升样本内预测准确度,策略效果优于仅做多基准。 二、风险与关注 1. 金融场景下强化学习应用的环境反馈缺失,导致样本拓展受限,当前策略的适用场景仅局限于样本内验证。 2. 多步DQN策略虽降低了自举的估计有偏性,但金融量价指标的选取与拟合质量可能对择时效果产生直接影响。 三、后续关注点 1. 进一步探索金融场景下强化学习的动作对环境反馈机制,拓展策略适用的样本范围。2. 将强化学习多步DQN策略拓展至个股CT相关领域,验证其在不同标的类型下的有效性。