您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:银河金工 组合优化系列时序截面三层深度学习模型预测收益风险信号 - 发现报告

银河金工 组合优化系列时序截面三层深度学习模型预测收益风险信号

2026-07-22 未知机构 ~ JIAN
报告封面

00:00:01 大家好,欢迎参加银河精工组合优化系列时序截面三层深度学习模型,预测收益风险信号。目前所有参会者均处于静音状态,下面开始播报声明。本次会议仅面向银河证券专业投资者客户,未经银河证券和演讲嘉宾事先书面许可,不得以任何形式将会议内容和相关信息对外公布、转发、转载、传播、复制、编辑、修改等。银河证券对违反上述要求的行为主体保留追究其法律责任的权利。 00:00:42 呃,各位投资者大家晚上好,我是银河精工的马普凡。呃,今天呃先由我来做一个简简短的开场,之后我的同事刘璐会为大家详细地,会为大家详细地讲解这份报告的一个具体内容。啊,那这边的话呢,主要还是就是呃,介绍一下我觉得我我们在这篇报告中值得关注的几个方向。 00:01:05 然后第一个的话呢,就是关于数据的选择,我们这里是就是也是包括比较有特点的一个地方,就是还是走了一条就是轻数据重特征的这样的一个路线啊。那前期我们其实也尝试过很多不同的这个就是数据源去做,但是这样的话呢,可能就会把这个问题变得就是有点复杂。因为本身这个计算的呃这样的一个流程已经相对来讲有点长了,所以说呃就是数据太多的话呢,就是有可能导致,呃我们嗯就就是并不一定把这个所有精力都放在这个就是模型上面啊,所以说现在的话呢我们做的做做的这样的一个就是。 00:01:42 策略的话呢,只需要呃指数成分股的一个权重数据,然后加上就是股票K线,就是全呃就是这些成分股的这个就是K线的呃高开低收,还有那个就是成交量成交额几个那个就是字段。然后就可以完成就是从信号预测到那个组合,呃权重输出的这样的一个整个的流程啊。那这边的话呢,我们觉得数据还是就比较简洁的情况之下的话呢,研究过程当中的一个调试和维护成本相对来讲就还是比较低,还是一个比较务实的这样一个出发点。 00:02:12 然后第二点的话呢,就是说我们在研究过程当中也是发现了嗯,就是风险指标的预测的稳定性还是比较明显,去好于这个收益类的指标啊。然后这也是这篇报告定定位在这个组合优化上呃,就是组合优化系列而不是这个就是因子研究系列的主要的一个原因啊。主要的呃我们的觉得可能的原因是因为就是波动率啊,还有回撤之类风险指标可能是有一个比较强的这个自相关,还有那个呃微观结构的支撑,所以说预测起来就或者说以我们的模型。预测起来可能相对会更加稳健一些啊, 00:02:45 然后呃第三个的话呢就是关于整个报告的这个结构啊,然后呃之后我同事刘璐会从这个就是特征工程啊,然后到这个预测标签啊的设计,然后包括这个我们整个的这样的一个。Time codeder加上那个就是图网络,然后加上MLP的一个3层的这个结构设计的思路,然后去跟大家做一个比较具体的这个介绍啊。 00:03:10 然后我们在做完这这这些工作之后的话呢,就是直接把这个就是预测的结果,然后作为一个因子化的这样的一个数据。然后呃,比如说我们这边预测的这个下普比率,可能就作为呃传统的这个阿尔法因子去用,然后那个就是呃最大回撤的话呢就作为这个风险因子去用。然后直接就可以放到这个传统的这些,这个呃组合优化的这个就是方法上,然后去生成这个就是股票的权重,然后去做呃这个增强的测算啊。然后最后的话呢是可以就是呃还是带入到我们原来的这个流程当中,然后实现一个比较好的这样的一个就是最终结果的这个展示啊啊好, 00:03:51 现现在我的开场就是呃到这里。然后下面的话呢,就是我的同事刘璐会跟大家做一个详细的介绍和汇报呃。刘路啊,好的好的,谢谢马老师的开场。然后下面的话,我这边就是去详细地介绍一下我们这篇报告的主要内容,然后包括这个模预测的模型是怎么构建的。嗯,下面的话就正式开始我们整个报告的详细内容。嗯,首先呢就是从整个报告的框架来说,我们这边嗯还是以前面的这个呃预测信号为主。所以可以看到我们这包括这个流流程图呢, 00:04:31 主要也是首先是呃就像刚才马老师说的一样,我们用的数据是比较简单的这个基础的,包括个股指数的K线就是高开低收呃交易量和交易额这些数据。然后以及指数成分股的权重,呃然后再经过呃清洗然后预处理,然后去呃这个构建了特征工程,我们这边是有是有42个指标之后呢,就可以放到我们这个深度模型的呃里面去做一个训练。以及预测最后的信号结果。 00:05:03 然后这边呢,具体来说其实就是我们这页PPT里面包括timingcoder,然后graphs以及MLP的呃这这三步, 00:05:11 其实就是我们这个深度学习预测的整个的模型。它它它就像我们这里展示的一样,它是一个呃线性的顺序,先在塔品克诺里面去挖掘它的时间序列上的关系,然后又在图网络里面去挖掘不同股票之间的相关关系。最后MLP呢是去起到一个降维的作用。它是把我们可能是呃前面16维的这个特征结果,最后降到1维我们输出的这个结果得到这个预测结果之后呢,我们就可以进一步地去做呃包括组合优化以及回测的执行。然后去评估我们这个信号是不是真真实的,在这个呃指数增强策略里面能起到比较好的效果。 00:05:55 效果后面呢,就是我们会详细的一步步去讲,我们包括数据是如何获取的。然后以及这个。 00:06:04 模型是如何构建的?那么首先是这个特征工程数据来源的话,其实呃就是无论是万德同花顺,然后等等各样各种各样的数据库都是OK的。呃,因为我们用到的就是最最简单的这个呃K线的数据,包括高开低收交易量交易额,然后以及指数的呃指数成分股的权重这些数据就是这些数据呢,它呃在每一个数据库里面它都不会有有什么差异,都它是一个比较呃容易获取到的数据。所以这也是我们模型最重要的一个特点。 00:06:38 呃在其次呢就是去构建了这个特征工程,我们这边是一共42个指标。呃首先呢就是最基础的K线的形态,包括可能上影线下影线呃箱体的这样的一些指标,然后以及更进一步,因为我们这里是指数增强的策略,所以在包括这个动量,然后以及可能ma的均均线。差 值这些基础的指标之上呢,我们也加入了包括相对于我们所选定的这个指数的超额收益,然后以及呃rsi等等技术指标。然后以及因为我们后面还去预测了最大回撤这样的一个风险信号,所以这里我们还加入了包括呃波动率下行波动率,然后最大回撤等这样的一些风险指标。 00:07:29 以及最后量价资金,这里其实也是一些我们可能平时最常用的量价类的指标,包括交易量和交易额的对数,然后交易量和。呃,收益率的相关系数,然后以及资金的净流入情况等等这样的一些指标, 00:07:47 那么现在得到这些指标的原始值之后呢,我们更进一步就可以去做分组标准化。 00:07:54 那么标准化这里其实我们呃是遵循一个在个股自己的层面上,然后在历史过去一段窗口窗口之内去做标准化的这样的一个原则。 00:08:07 呃,具体来说呢,我们是在每一个个股的维度上,然后去用他们最近50期的。指标的数据去做了一个z score的标准化,这里的话我们的思路就是说呃以波动率这个呃特征为例的话,呃比如说科技股可能一直以来都是一个相对高波动的这样的一个股票,但是金融股可能相对来说是一直比较低波的一一些股票。如果我们是在截面上去在不同股票之间做标准化,那其实呃可能呃科技股标准化出来的结果就一直是偏高的,然后金融股就一直是偏低的,这样其实是一个不太合理的呃方法。 00:08:49 所以我们这边在个股自己的时间序列的层面上去标做标准化呢,就是相当于去和它自身比较,可能科技股呃最近一段时间它。和自己历史相比波动率有所降低,但有可能还是会比金融股的波动率要更高一些。所以我们这里是去看这个股票的这一个指标,在它历史水平上是大概处于一个什么样的位置,以及呢,我们嗯,还是回到上一页。我们这边呃也是对这个特征去做了一些分组。 00:09:26 呃准确来说呢,我们这边除了第一行这一形态就是刻画K线形态,这里我们是没有做标准 化的。因为这里的话,我们还是希望能遵循我们人在真实投资过程中是会直接去看K线,它最原本的这个呃形态是不,我们是不会在脑子里去做一些什么标准化之类的这样的处理的。所以我们这边也是去看K线最原始的这个数据形态,然后在下面的这些包括收益动量,然后量价这些指标,我们是去做了标准化。 00:10:01 以及呢,嗯,有有输入就有输出,所以这里输出值换句话说,我们要预测的标签,嗯,具体来说是选了包括阿尔法夏普以及最大回车这3个指标。嗯,其中因为我们后面的指数增强策略是在月平的基础上去做调仓的,所以这里阿尔法和夏普比率呢,也是选的未来一个月的这这样的一个周期最大回撤。因为一般我们看这一类的指标看的周期更长一些,所以这里选的是未来3个月,也就是66个交易日,选这三个指标也是会更符合我们人类投资者的决策过过程, 00:10:33 具体来说的话,呃,我们在。嗯,具体来说,我们在这个投资过程中也是会去考虑,呃,包括比如说这个股票未来一段时间上涨的空间有多大,然后以及它的上涨可能是不是比较稳定的,以及如果它发生回撤的话,那回撤的最大幅度可能有多少。所以我们这里也是呃预测了三个不同的指标,就是希望能综合地反映我们呃。我们人类在真实的投资过程中会去考虑的这些因素,那么在呃完成了指标的构建之后呢,下一步我们就可以去呃搭建我们的这个模型了。 00:11:13 嗯,我们这里的模型呢,就像呃前面提到的一样,它是一个线性的,然后准确来说就像这一页的PPT里面这个input呢,就是我们前面去构建好的42个呃特征特征值,然后input先去输入到Transformer里面,它会输出一个16位的结果。这个16位的结果呢,同时又是graphage的输入值,Graph graphsage来来挖掘到它们截面上的相关关系。之后呢,它的输出结果又是后面MLP的输出值。最终MLP把它降维到一维一维的我们这三个信号的这呃预测结果。呃,然后,而且因为是我们是预测了3个信号,所以严格来说, 00:11:59 我们是呃这边是要去分别训练3个模型。就是从input到最后的三个信号之间,呃中间的这三层它们是不会去共用的,我们要分别的去训练3次。呃,最后的output呢,它也是一 个一维的结果,而不是一个三维的结果。这。 00:12:24 呃,更进一步我们就去看一下我们这个模型的一些细节。呃,首先首先是他们code的这一层,然后准确来说呢,就是我们会包含了四个部分。呃,首先是线性投影,然后位置编码,然后用Transformer去提取它的这个特征值,然后最后去做了一个注意力池化,然后把它呃处理到最后我们输出的这个16维的结果上。呃,我们用Transformer这个模型呢,呃。 00:12:50 总体来说没有做什么特非常特殊的处理,呃当然它还是非常有优势的,就是首先相比LSTM这些模型,它可能会更适合高维然后长窗口的小时级输入,然后而且它还可以直接去捕捕捉,呃不同时时间窗口之间的这个依赖关系。嗯,这样在样本量比较大的时候呢,它训练的效率也会更高一些。嗯,这边首先是他他明code的的这个特点,然后我们后后面的报告呢,其实重点还是去讲了这个我们图网络是怎么构建的,然后以及这个模型的原理等等的一些内容。 00:13:29 嗯,那么具体来说让graph search它是嗯。它是嗯,它作为一个图网络络模型,它最大的特点就是。什么样的节点才是邻居节点?这个问题是需要我们自己去定义的,换句话说,就是一个sample采样的过程。嗯,就好比我们这一页P P图PPT里面这张图,那么中间这个红色节点是我们要去更新的节点,而周围的这些节点呢,我们都可以认为它是邻居节点。但是这样的话,那整个图可能邻居节点就太多了,因为像我们后面呃如果用沪深300去呃构建图网络的话,那整张图里面300个节点,那每一个都有连接的话,那这样训练起来会非常的慢。 00:14:15 所以Graph s的模型它最大的特点就是首先我们要去定义这个节点。怎么样才算连接在一起,或者说怎样才算是邻居?然后以及节点的数量我们都是可以去做一个限制的。那么在采好样之后呢,我们更进一步就可以嗯去聚合不同邻近节点之间的信息,然后以及结合它自身的原本