您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:AI量化选股研究新进展20260729 - 发现报告

AI量化选股研究新进展20260729

2026-07-29 未知机构 惊雷
报告封面

时间:7月29日参会人:无 全文摘要 本次线上直播将聚焦量化投资领域的前沿动态,特别探讨人工智能在量化选股中的创新应用。直播中,两位分析师将分享关于利用AI增强的成长趋势选股策略和多模态proactive架构下的混合因子合成方法。重点分析深度学习及大模型技术如何革新因子选股框架,实现从预测趋势到多模态因子融合的突破,成为量化策略迭代的关键。此外,还将讨论如何通过大模型处理非结构化文本信息,以及这些信息如何提升选股策略的效能,尤其是在成长趋势选股策略中的应用。本次直播旨在展示量化投资领域的最新进展和实践案例,为投资者提供新的思考角度和策略灵感。 章节速览 00:00AI增强成长趋势选股策略:非结构化文本信息的应用 本期直播聚焦AI在量化选股领域的应用,特别是如何通过大模型处理非结构化文本信息,以增强成长趋势选股策略。传统策略基于结构化数据筛选优质成长股,而AI增强则引入大模型处理文本,挖掘行业竞争格局等信息,有效提升了策略收益,年化贡献达十个百分点。汇报分为策略介绍与AI应用细节两部分,展示了AI在量化选股中的落地逻辑与实操思路。 04:44成长趋势选股策略解析:从加速增长到防御性因子的综合考量 对话详细阐述了一种成长趋势选股策略,该策略通过构建加速增长的基础池,剔除负面特征个股,再结合进攻性和防御性因子进行综合打分,最终选出30只股票。策略核心在于识别未来能延续高增长的优质成长股,通过样本外跟踪显示,该策略年化收益接近20%,且每年均有超额收益,体现了其在市场中的有效性。 10:35AI增强策略:引入行业信息提升成长股选股 讨论通过AI技术,特别是大模型处理非结构化文本数据,以提取行业层面信息,增强成长股投 资策略,弥补原有策略中行业信息的缺失,提升选股质量。 13:40大模型解读年报半年报:评分标准与结果稳定性 讨论了使用大模型解读上市公司年报半年报文本,提取核心信息的过程,重点在于设计明确的评分标准,确保评分结果的稳定性,以支持定量模型的应用。分享了如何定义评分标准,以及验证大模型评分稳定性的重要性,通过重复提问同一文本,观察评分一致性,以评估模型的外推能力和策略贡献的预期稳定性。 19:44大模型文本分析稳定性探讨与策略应用 对话围绕大模型处理非结构化文本信息的稳定性展开,指出产品渗透率评分不稳定源于文本信息缺失,建议关注文本直接相关性以提升稳定性,并探讨将提取的文本因子应用于成长策略的方法。 24:05大模型处理文本信息在量化成长策略中的应用 讨论了将大模型处理的文本信息引入量化成长策略的方法,通过文本评分筛选行业需求上行且可信度高的公司,增强策略效果。回测显示,自2021年起,新策略表现优于原策略,尤其在2024年后贡献显著增加。分析认为,策略效果与市场环境中的行业分化趋势密切相关,优质行业选取在行业K型分化背景下贡献更为显著。 30:27多模态Proactive架构下的混频因子合成研究 分享了将混频因子合成任务类比为多模态问题的研究报告,提出了一种名为STD模型的新方法,该模型利用交叉注意力机制处理不同频率因子间的相关性,特别是在日频和月频因子上。研究通过中证疫情指数成分股训练并测试,构建多头组合相较于中证1000指数取得显著超额收益,年化达到23.48%。强调了多模态学习和交叉注意力在量化投资领域的应用潜力,以及如何高效整合基本面数据以构建稳健复合策略。 35:15基于ProFation的Star模型:多维度相关性学习的金融预测 报告介绍了一种基于ProFation的Star模型,该模型通过五个核心网络结构,包括因子嵌入层、持续编码层、持续池化层、截面自注意力层和回归率侧层,对日频和月频因子进行多维度相关性学习。模型设计中,使用一维卷积网络处理不同频率的因子,通过自注意力机制学习截面股 票间的相关性,并采用RankIC作为损失函数优化模型参数。此模型旨在通过相对收益预测提高多头组合的回测表现,相较于传统模型,更注重股票间和时间序列上的相关性学习。 44:09Star模型在混平因子合成任务中的优势与训练机制探讨 讨论了混平因子合成任务中,传统模型如叉boost和GRU存在的局限性,特别是对时序维度特征建模能力的不足。提出了基于cosnation的Star模型,通过QKV设计有效处理不同频率数据,无需数据填充和频率对齐。详细介绍了模型的滚动窗口训练机制,确保训练稳定性和回测鲁棒性,训练过程共重复八次,测试集覆盖22年下半年至26年三月底。 47:41大模型在因子合成与预测中的应用及效果分析 通过中证疫情指数成分股的数据,构建了预测未来20个交易日股票收益率的模型,采用140个日频基本面因子和88个周频基本面因子。模型经过三次独立随机数种子训练,平均结果展示。回测显示,多头组合相较于中证1000指数有显著超额收益,SR为1.36,年化超额23.48%,超额夏普2.16。模型在低频和高频任务设定下均表现良好,展示了在因子合成任务上的建模能力和潜力。 51:21深度学习模型结构优化与消融实验分析 对话讨论了通过消融实验验证模型结构优化的有效性,包括网络模块增减对模型性能的影响,以及卷积核选择对模型表现的贡献。实验结果显示,增加的网络模块提升了模型性能,而卷积网络相较于全连接网络在样本外表现更优,证明了模型结构选择的合理性。 55:08深度学习模型STAR在量化投资中的应用与归因分析 报告介绍了基于深度学习的STAR模型在量化投资中的应用,通过多模态视角对因子合成任务进行建模,分析了模型对九个风格因子的暴露情况,揭示了低估值、低波动和小市值的选股风格。同时,报告展示了模型在行业层面的选择偏好,从医药、机械、计算机等行业转向基础化工和有色金属,为投资者提供量化任务的新思路。 思维导图 问答回顾 未知发言人问:本期节目中,我们将重点讨论哪个AI增强的量化选股策略?成长趋势策略中如何利用AI增强选股逻辑? 未知发言人答:本期节目中,我们将重点分享一个基于AI增强的成长趋势选股策略,该策略旨在结合大模型处理非结构化文本信息,并将挖掘出的有价值信息应用于传统的成长趋势选股模型中。在成长趋势策略中,AI增强的作用体现在对非结构化文本信息的处理上,通过大模型提取行业格局、竞争环境等方面的重要信息,并将这些信息融入到原有的成长趋势选股模型中,从而提升策略效果。据报告,结合大模型处理的文本信息后,该策略的收益年化贡献提升了十个百分点。 发言人问:AI在量化选股中有哪些主要应用场景? 未知发言人答:AI在量化选股中的应用场景主要包括两个层面。一部分是利用预处理好的结构化特征,通过复杂模型整合后直接对收益进行预测;另一部分则是运用大语言模型和NLP技术处理非结构化信息,如文本和图像等,将其转化为结构化因子,为选股策略提供支持。 发言人问:成长趋势选股策略的基本运行逻辑是什么? 未知发言人答:成长趋势选股策略的运行逻辑主要包括三个步骤:首先,从基础池中筛选出利 润环比增速和加速度指标表现良好的公司形成初步候选池;其次,对候选池中的股票进行负面特征的剔除,比如非定向性转移占比高、偿债能力差等;最后,在剩余股票中综合打分,选取30只股票构建最终的投资组合。 发言人问:策略在样本外跟踪的情况如何? 未知发言人答:策略在过去22到24年间,对样本外跟踪有较大贡献,并且一年以来整体收益接近20个点。 发言人问:策略如何对比偏股混合型基金指数的表现? 未知发言人答:策略的绝对收益净值优于该指数,黄颜色折线代表了策略相对于基准的超额贡献,每年都有一定的超额收益。 发言人问:这个策略的核心逻辑是什么? 发言人答:这个成长趋势共振选股策略的核心逻辑是找到那些未来能够持续增长、优质的成长股。 未知发言人问:如何进一步提升和补充现有策略的信息? 发言人答:策略在构建过程中已考虑了财报利润情况、盈余质量、市场反映和分析师观点等因素,但未充分考虑行业层面的信息。通过使用大模型处理非结构化文本(如年度和半年度报告),提取行业层面信息并转化为结构化数据,可以更高效地引入到策略中进行应用。 发言人问:大模型在策略中的具体应用是怎样的? 未知发言人答:通过大模型解读年度和半年度报告中的文本信息,设计出九个问题模板,向大模型提问以提取关键信息,然后根据预设的评分标准将非结构化文本转化为结构化数据,为策略提供更丰富的行业层面信息支持。 发言人问:在使用大模型解读年报半年报文本时,首要考虑的维度是什么? 发言人答:首要考虑的维度是为大模型设定一个明确的评分标准,以便我们能理解并信任其给出的分数。 未知发言人问:第二个重要问题是什么? 未知发言人答:第二个关键问题是观察大模型生成的观点是否稳定。如果给定相同的输入和报告文本,模型的评分结果却波动较大(例如从五分变为四分、三分),则难以相信其外推能力以及未来策略的稳定性。 未知发言人问:如何检验大模型评分结果的稳定性? 发言人答:我们通过随机抽取一个财务报告文本,让大模型重复进行十次评分以观察其稳定性。结果显示,对于提出的九个问题,大部分情况下模型的反馈信息相对稳定。 未知发言人问:是否存在某个问题导致评分结果不稳定? 发言人答:是的,产品渗透率这个问题的评分结果就较为不稳定。其原因在于相关文本信息较少甚至没有直接描述,导致模型在推理过程中获取不稳定的结论。 发言人问:如何提升大模型处理文本信息时的稳定性? 未知发言人答:建议在处理文本时,应对文本可能包含的信息有清晰的理解,只在文本中有直接相关信息的情况下获取稳定结果,避免基于间接信息的推理带来的不稳定性。 未知发言人问:如何将文本评分引入到选股策略中? 发言人答:我们可以通过在选股流程中插入文本评分筛选步骤,选择那些行业需求评分较高(如五分)的公司进行投资,这样可以增强原有的成长策略,筛选出行业需求上行且有数据支持的股票,并最终构建投资组合。回测结果显示,结合文本观点的策略实施效果良好。 发言人问:新AI增强的成长策略与原成长策略相比,在绝对收益净值上有何表现? 发言人答:新AI增强的成长策略的绝对收益净值(红色折线图)相较于原成长策略(黄色折线图)表现更理想,特别是在21年到23年间,虽然提升相对缓慢,但在24年9月以后,新策略有了大幅的提升。 发言人问:新成长策略相对于原成长策略的相对收益贡献如何体现? 未知发言人答:新成长策略相对于原成长策略的相对收益贡献通过橘色曲线来展示,这条曲线显示长期来看每年都有一定的贡献,尤其是在24年9月以后,贡献出现了明显的大幅增加。 发言人问:新策略在不同年度间的收益差异是如何变化的?为什么新策略在不同年度间的收益差异会有如此显著的变化? 发言人答:在21年和22年,新策略与原策略的年化收益差异较小,在4到7个点左右;但在24年、25年和26年,收益增强幅度显著增大,可达10到20个点的差异。主要原因在于策略逻辑的改变,大模型提取的低频行业层面信息对选出长期向好的行业起到了重要作用。在市场环境快速轮动、缺乏明显行业趋势的年份(如22、23年),这种信息的贡献有限;而在行业明显分化、K型行情突出的年份(如24、25、26年),优质行业的选取为策略带来了更大的贡献。 发言人问:多模态proactive架构下的混皮因子合成方法的研究内容是什么? 未知发言人答:报告介绍了在多模态proactive架构下,如何利用跨注意力模块crosstention解决混皮因子合成问题,并提出了名为stpcrosstention的模型。该模型成功完成了对不同频率因子内部、不同频率因子之间以及截面上的相关性刻画,通过中证1000指数成分股的训练和回测,在构造的测试区间内取得了年化超额收益23.48%的成绩。 未知发言人问:模型输入数据的构造方式是怎样的? 发言人答:模型输入数据以一个四维张量形式构造,其中四个维度分别是样本数量(BTN)、因子频率(T)、观测股票数量(N)和因子数量(M)。对于日频