核心观点
- 传统因子研究方法存在效率低、结果不透明等问题,难以满足当前市场对因子研究的需求。
- 大语言模型(LLM)具备较强的金融逻辑推理能力,但缺乏系统性搜索机制和持续迭代优化流程。
- LLM-MCTS框架结合LLM的语义生成能力和MCTS的搜索控制能力,能够有效解决上述问题,实现可解释的因子迭代挖掘。
关键数据和研究结论
- 日频价量因子迭代挖掘: 以29个低频价量因子为Seed,通过LLM-MCTS框架进行迭代优化,结果显示候选池层面25/29个Seed至少搜索到过样本外优于原始Seed的候选,最终入选因子在样本内全部优于原因子,其中19个在样本外仍优于原因子。
- 批量低频因子挖掘: 以12个根节点机制作为起点进行批量搜索,样本内生成的173个因子优于对应原始Seed,143个同时实现样本内和样本外优于原始Seed,双优候选去重后包含123个公式,相关性分析显示搜索结果没有坍缩为少数同质信号。
- 高频因子挖掘: 给定原始的经验因子作为Seed,利用LLM-MCTS搜索框架,可以得到更高质量的高频因子,其中“高量脉冲次数”因子表现最突出。
风险提示
- 模型失效风险
- 过拟合风险
- 数据质量风险
- 大语言模型生成风险
- 交易成本与流动性风险