核心观点
本报告依托DeepSeek大模型,将情感分析从研报标题拓展至摘要,实现从黑箱评分向结构化、可解释评分的转变。通过拆解摘要结构,引入类别识别、情绪倾向、出现顺序及字数占比四维量化分析,重构研报摘要价值。
关键数据和研究结论
- 分类识别:将摘要内容分为业务发展、财务表现和其他因素三大类,并细分为十个子类,如战略布局、技术创新、渗透率提升、经营效率提升、盈利改善、财务稳健性提升、业绩对比预期与同业、股东行为、政策驱动、市场驱动。
- 情绪倾向:为便于快速统计与高效信息整合,引入情绪倾向判断机制,用简洁明了的数字标签来表征各类别所对应的情绪色彩,其中1代表正面利好,-1象征负面利空,0表示中性。
- 出现顺序:在信息处理进程中,融入顺序记录,捕捉各类别在摘要中的出现次序,基于一个假设:前面提及的利好因素,可能更具代表性与优先级,或是更能契合当下市场关注焦点。
- 字数占比:计算每个类别在摘要全文中的字数占比,反映各类别在摘要中的文本权重,字数占比高的类别,通常包含更丰富的内容和细节。
- 利好密度:构建了“利好密度”指标,用于衡量特定时间段内,某一类别的利好情绪在全部情绪中的相对占比,从而量化个股受到该类别利好“密度”的影响程度。
- 研报评分因子:构建了四类研报评分因子(简单加权、篇幅加权、类别重要性加权、篇幅&类别重要性加权),并引入集中度调整与非线性权重进行优化。
- 综合评分因子:将四类因子等权合成为个股综合评分因子 풔풄풐풓풆_풓풆풑풐풓풕_풍풍풎,其整体表现稳健,五分组收益结构严格单调,具备一定选股与收益预测能力,且与传统因子相关性较低。푠푐표푟푒_푟푒푝표푟푡_푙푙푚的多头年化收益为 12.8%、相对中证800的年化超额13.5%,自2020年以来年胜率为100%,今年截至5月底的月胜率为100%,超额10.4%;整个区间的最大回撤控制良好,相对等权组合均控制在4%以内,2025 年更仅为 1.2%。
研究方法
本报告采用DeepSeek大模型,通过系统提示规则,对文本内容进行归类、情绪判断、记录出现顺序、计算字数占比,并按照规定格式输出结果。同时,引入了多种评分方法,并分析多种方式对未来超额收益(CAR5/CAR20/CAR60)的回归分析结果,主要比较它们在回归系数、显著性、模型解释力(R²) 和 Rank IC(日度横截面预测力) 四个维度的表现。
研究意义
本报告的研究结果表明,通过DeepSeek大模型对研报摘要进行结构化情感分析,可以有效挖掘研报中的潜在价值信息,为投资决策提供有力支持。