您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [国金证券]:大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?-投研Agent模型能力对比评测 - 发现报告

大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?-投研Agent模型能力对比评测

2026-07-19 高智威,许坤圣 国金证券 张博卿
报告封面

金融工程组分析师:高智威(执业S1130522110003)gaozhiw@gjzq.com.cn分析师:许坤圣(执业S1130524110001)xukunsheng@gjzq.com.cn Kimi K3超越GPT 5.6了吗?—投研Agent模型能力对比评测 2026年7月,OpenAI与Moonshot AI先后推出面向长程Agent任务的新一代模型GPT 5.6和Kimi K3。为评估新一代模型在真实金融研究场景中的综合能力,本次测评将上述两款模型与GLM-5.2进行横向比较,围绕估值建模、多因子回测和行业研究三类典型金融投研任务展开实测。相较于单轮问答测试,本次任务更强调复杂工作流下的连续执行与成果交付,不仅要求模型理解较为开放的研究需求,还需要自主拆解任务、规划执行路径,并在多个工具和数据源之间完成协同操作。 三类金融投研任务表现 综合三类投研任务的表现,三款模型均已具备完成复杂投研任务的基础能力,其中GPT 5.6 Sol综合表现最佳,在任务完成度、研究细节保留和长程执行稳定性方面均较为突出;Kimi K3的报告结构和分析逻辑整体较好,但底稿联动和任务执行稳定性仍需提升;GLM-5.2擅长任务拆解与报告展示,但底稿报错、结论不闭环及Wiki断链影响了交付物的可用性。需要说明的是,本次Kimi K3测试于模型发布当天进行,测试过程中出现推理速度较慢和请求无法响应的情况,可能受到发布首日访问量和服务负载影响。因此,本文主要评价其已经完成的交付结果,暂不对响应速度和服务稳定性作出确定判断。与此同时,本次结论仅基于有限次数的任务测试,也可能受到任务样本、提示词设计和推理模式等因素影响,后续仍需通过多轮测试验证结果的稳定性和可复现性。 估值建模方面,GPT 5.6 Sol的预测逻辑较为清楚,Excel模型能够联动更新,可复算性和可检查性最好。Kimi K3采用“销量×单价”预测收入,报告逻辑基本自洽,但底稿缺少联动,部分公式错误影响数据复核。GLM-5.2的底稿存在多处公式异常,目标价与投资评级也出现逻辑冲突,表现相对较差。 多因子回测方面,GPT 5.6 Sol明确采用“月末形成信号、下一交易日执行”的方式,交易时点处理最为严谨。KimiK3保留了Python代码、每期选股、组合收益和净值等结果,计算过程的可检查性较好,但没有明确区分信号日与执行日,也未完整处理交易成本和不可交易状态。GLM-5.2覆盖区间较长,但同样存在交易时点和交易约束问题,中间计算过程的披露也相对不足。 行业研究方面,GPT 5.6 Sol的研究逻辑和来源管理最为规范,但公司实体页较少。Kimi K3的报告和投资框架较为完整,但Wiki内容沉淀不足。GLM-5.2覆盖公司最多、展示效果较好,但投资框架分析逻辑不够清楚,来源管理和内部链接也不完整。 风险提示 结果通过历史数据统计、建模和测算完成,历史规律不代表未来;在市场环境发生变化时,模型存在失效的风险;策略依据一定的假设通过历史数据回测得到,当交易成本或其它条件改变时,可能导致策略收益下降甚至出现亏损;大模型输出的内容存在一定的随机性和准确性风险;本文所提炼的观点,基于一定的提示词产生,大语言模型输出的结果可能随着提示词的变化而发生变化。部分应用本身可能存在一定的安全风险,在使用此类应用时,用户需自行承担由此可能引发的任何风险和后果。在使用AI生成内容时,需要注意相关版权问题。用户应确保所使用的工具及其生成的内容符合相关法律法规的要求,避免侵犯他人知识产权。 内容目录 一、GPT 5.6 Sol与Kimi K3发布:能力升级与公开表现.........................................4 1.1Kimi K3:以超大规模和开放权重为特色的Agent..........................................41.2GPT 5.6:以Token效率为核心的高性价比旗舰...........................................41.3三模型公开规格、API价格与任务成本对比...............................................51.4三模型公开能力对比..................................................................6 二、三类金融投研任务实测点评..............................................................7 2.1估值任务...............................................................................72.1.1各模型估值建模表现...................................................................82.1.2各模型估值任务能力总结..............................................................122.2回测任务..............................................................................132.2.1各模型回测任务表现..................................................................142.2.2各模型回测任务能力总结..............................................................182.3行业研究任务..........................................................................192.3.1各模型行业研究任务表现..............................................................202.3.2各模型行业研究任务能力总结..........................................................23 图表目录 图表1:主要模型综合能力与输出Token消耗对比..................................................5图表2:三模型公开规格与API价格对比..........................................................5图表3:主要模型综合能力与单任务成本对比......................................................6图表4:多基准对比顶尖模型....................................................................6图表5:Artificial Analysis Intelligence Index得分排名........................................7图表6:估值任务prompt总要求.................................................................7图表7:估值任务分点要求(节选)..............................................................8图表8:估值任务逻辑链........................................................................8图表9:Kimi K3交付的估值模型工作簿...........................................................9图表10:Kimi K3交付的投资分析报告............................................................9图表11:Kimi K3经营预测拆解逻辑..............................................................9图表12:Kimi K3部分公式异常..................................................................9图表13:GPT 5.6 Sol交付的估值模型工作簿.....................................................10图表14:GPT 5.6 Sol交付的投资分析报告.......................................................10 图表15:GPT 5.6 Sol经营预测拆解逻辑.........................................................11图表16:GLM-5.2交付的估值模型工作簿.........................................................12图表17:GLM-5.2交付的投资分析报告...........................................................12图表18:GLM-5.2经营预测拆解逻辑.............................................................12图表19:GLM-5.2摘要页出现公式异常..........................................................12图表20:模型估值任务表现对比................................................................13图表21:回测任务Prompt总要求...............................................................13图表22:回测任务分点要求....................................................................13图表23:回测任务逻辑框架....................................................................14图表24:Kimi K3交付的多因子回测报告.........................................................15图表25:Kimi K3交付的研究报告...............................................................15图表26:Kimi K3多因子回测图.................................................................15图表27:GPT 5.6 Sol交付的多因子回测报告.....................................................16图表28:GPT 5.6 Sol交付的研究报告...........................................................16图表29:GPT5.6 So