您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:国金金融工程 Kimi K3超越GPT 56了吗投研Agent模型能力对比评测 - 发现报告

国金金融工程 Kimi K3超越GPT 56了吗投研Agent模型能力对比评测

2026-07-19 未知机构 LLLL
报告封面

00:00:01 大家好,欢迎参加国金金融工程kimik3超越GPT5.6了吗,投研Agent模型能力对比评测。目前所有参会者均处于静音状态,下面开始播报声明,本次电话会议仅面向国金证券的专业投资机构客户或受邀客户,仅供交流研究观点。专家发言内容仅代表其个人观点,会议内容并不构成对任何人的投资建议,未经国金证券事先书面许可,任何机构或个人严禁以任何形式将会议内容和相关信息对外公布、转发、转载、传播、复制、编辑、修改、解读等。涉嫌违反上述情形的,我们将保留一切法律权利。感谢您的理解和支持,谢谢。 00:00:53 各位线上的投资者晚上好,欢迎参加我们的电话会议,我是铂金证券金融工程团队的研究员徐福胜。 00:01:02 本次会会议的话,主要给各位投资者去呃,做一下近期的一些大模型的一个测评的一个工作。那近期的话包括说海外的这样子的一个GPT的5.6,还有说国内的这样子的Kimi K3,其实的话都是相继续发布的, 00:01:19 然后的话,其实我们能够在很多的一个公众号啊,或者各个维度的话都看到了很多的一个测评的工作,以及啊大家的一个无论是。呃,他的一个广告帖或者说它的一个真实的一个测评贴,当然的话,总体上来说,都是从一些通用性的一个角度去做我们的一个他的一个能力的分析。所以的话,我们其实这次更多的可能是聚焦于说在一个金肉投研领域,去对它的一个模式的一个考察的一个维度。 00:01:49 因为我们整体团队的话,其实一直在做呃大模型投研赋能这一块的话也呃深耕了挺久啊,从一个GPT3.5开始出来之后就一直跟着这条路线,所以的话其实包括说。今年这样子的一个虾,还有说呃各种的一个大模型的一个呃呃软件开始火起来之后,我们也去积累了很 很多的这样子一个金融投研的一个场景。所以的话,这次其实我们主要是围绕着说这样子一个金融投研的一个场景,去做了一些呃关于GPT5.6,so还有说Kimi K3以及我们那个对照组的一个g a5.2,它的一个整体的一个一个对比。 00:02:28 那呃Kimi K3的话其实是在也刚刚发布不久啊,七呃7月的一个16号,那目前来说它的一个已经算是开源的参数规模量是最大的,2.8万亿。即使是说刚今天刚发布的那样子一个千问3.8preview版本啊max对吧,它的话三呃参数量的话可能也就是2.4万亿这样子一个水平线上面。以及的话除了说它的这样子一个参数量的规模大以外的话,从它的一个架构和功能的一个能力上面也是有一个比较明显的。 00:03:03 一个提升的现在的Kimi K3的话,呃,除了说像是。呃,传统的版本模型以外,它更多的还是一个多模态的一个模式,多模态的一个能力的话,会使得说我们平时在我们的一个办公场景,还有说使用场景的一个截图规划等等去看啊,理解我们的一个任务的一个情形,也是会更加的一个方便的。那前期今年啊,大家其实都说就是我们国产的模型,还有说海外模型它的一个能力的话,可能差到3个3~6个月,但之前来说更多的还是说它的一个文本的一个。 00:03:38 啊文本处理推理的一个能力,其实啊很多的一个前线的一个就是前沿的一个开源模型,其实还没有去配备好这样子的一个多模态的一个能力。不过的话我们能够看到说,在呃TIMIK3这样子的一个呃前呃前沿的一个国内的开开开源模型里面,它已经把三个维度都已经哎啊聚集起来了, 00:04:03 包括说我的一个长文本的一个能力啊,100万的一个上下文,以及说我的一个多模态的能力。那包括说我的一个Agent多Agent以及说各种构建呃构建,还有说运行的一个智能体的一个能力的话,其实都在往前去推。那我觉得说Kimi K3其实算是一个呃标志性的一个一一个一个一个产品,就是使得说三个领域起码都能够赶上了,呃,就是能够和海外的这样子的一个模型进行PK,而不是说单点的一个维度, 00:04:35 因为即使我们去看到说G5.2。它也啊只是一个纯粹的一个文本模型,它如果多有要有多模态的能力的话,可能还要回到说啊质谱的话,可能还要回到它的那个呃GLN5.1呃V9版本,那可能它才有它的一个多模态的能力。 00:04:53 在前沿端的这样子GLN的5.2的话,其实都还是没有多模态的能力,包括说千万的3.8maxQ6也是这样子的一个版本模型,对,所以的话,就是我们觉得说Kimi K3的确来说还是有比较大的一个象征意义的。 00:05:08 那呃在推前到前面来说的话,GPT的5.6其实也都是在发布了,然后也能力上面还有说它的工作效率维度都有一个明显的一个提升,所以呃,上面的话是简单的,我们关于说模型本身的一个介绍吧。其实我们今天来说,更多的可能还是回到它的一一个是模型对比,以及说金融的一个场景上面一起去看啊。 00:05:34 不过在开始我们的一个金融投研分析之前,我们也还是说从一。一些啊基础基准的一个测评,还有说我们的一个API I价格啊等等一个角度的话,去分析一下说这些模型。那我们首先的话去看了一下,说对比呃这些国产呃国产和海外大模型的一个价格上面的话都是前沿,这样这个模型,呃整体来说,肯定还是海外的一个模型的一个价格上面相对来说是会会贵的。 00:06:00 那销售GPT5.6的soul的话,呃输入的价格大概是5美刀,然后输出的话是30美刀。那Kimi K3的话整体的一个价格其实也是有一定的幅度抬升的。现在来说我们的呃呃KimiK3,它现在的一个价格的话已经输入来到了这样子一个3美元,然后的话输出的价格来到了15美元,这样情况已经是这样子,一个GPT5.6售的这样子一个一半的一个价格了。 00:06:26 那我们再对对比回去说前期之前我们都说GN5.2,它的一个价格呃也也不便宜对吧,但是的话我们能看到说GLN5.2的一个输入价格其实就是。8元,然后的话输出的一个价格是28元,那相较于Kimi K3的这样子的一个价格的话,其实还是有比较。一个一个一个差距的,或者说就是K呃,能够看到说Kimi K3它这样子一个价格的话,已经啊已经已经是这 样子一个前沿模型的一个一半的一个水平, 00:07:01 所以如果说它的一个工作效率没呃。只是GBT5.6的一个1/2的话,那他们其实整体的一个呃成本的话,其实不会说差别特别大的一个一个情况。那这个是他API I的一个定价。 00:07:19 所以的话其实我们要基于我们的工作场景,然后去看说我们的一个真实的一个啊对于同样的一个效果的一个输出,然后我们去看说我们的a HR的一个使用量,去看啊来综合去分析这样子的一个一个一个问题,在最后的一个效能的一个角度。那那再看回去说我们它的一个基准对比,的确来说,Kimi K3我们能够看到和GBT5.6so它的一个能力的话,很多的一个情况已经呃不是不相上下了。那呃我们选了几个呃无论是说Kimi K3GPT5.6, 00:07:54 还有说GPT5.2都有一个测评的一些呃基准去看啊,包括说一些编程和A的一个能力。 00:08:01 那在编程的一个能力的话,呃编程的一个能力方面的话,我们选呃就呃对比了一下说DWS1,还有说program呃program bench以及呃以及说terminal bench2.1这样子的一个维度。那我们能够看到说Kimi k呃像说是DeepSeek呃deep WSW1的话,呃Kimi K3它的一个跑分的话大概来说是一个67.5,然后GBT5.6,so,的话大概是73,然后GBGLN的5.2的话,呃可能就相较于两个其他两两两者来说会低很呃低比较多的一个情况,只有一个40。 00:08:37 6.2的一个水平,那到一个program bench的话,其实的确了,甚至来说Kimi K3的话已经在数值上面反超了GPT5.6so的一个情况,Kimi K3的话是77.8,然后的话GPT5.6so的话是一个77.6的一个情情况啊,大概超越了一个0.2的一个水呃分分值,那g a5.5.2的话。是63.7的一个情况。 00:09:03 那Terminal bench方面的话,可能Kimi K3略分值上面略低于GPT5.6的一个0.5个呃分呢,但是的话其实都都挺强的,都达到了88呃呃Kimi K3是88.3,然后的话GBT5.6的话是88.8的一个水平线。那GLN5.6呃呃GN5.2的话也是说稍比他们两者偏低一点点,只有 81的一个水平线。 00:09:28 那我们再看一个像说是A方面的一个跑分,MCP Atlas这块的话也是Kimi K3其实是领先于GPT5.6so的。呃Kimi K3的话是84.2,然后Kimi然后GBT5.6so的话是83.6,然后GBT5呃GLM5.2的话也是低于两者只有一个76.8。 00:09:49 那所以的话其实从一个这样子一个通用的一个基准去看的话,我们可能会发现说呃KimiK3啊可能已经和GPT5.6,so有呃。有来有回了,但是的话的确GLM5.2的话可能在改各各方面的能力了来说的话,相较于前前两者可能还是会稍逊一筹的一个情况,那这个的话是一些通用的一个能力的一个对比啊。 00:10:15 那再回到说我们本次的会议的一个重点就是说,那在我们金融投研的一个使用的一个方面的话,整体它的一个情况是怎么样子的?那我们本次测评的话,其实也是做了三个维度的一个事情啊,啊包括覆盖了一些。呃,主动投研的一个场景以及说我们量化的一个一个场景,那去包括做一些让他去做估值建模底表,然后以及呃在基于故事建模底表的话去输出报告。那还有说去做我们的一个主动投研,基于研报里面去做我们的一个知识库个公司知识库,以及说它的一个产业链分析,以及做最终去输出我整一个行业的一个分析逻辑以及分析报告等等, 00:10:57 这样子的一个两个主动投研的一个任务。那还有说关于我们的一个呃,量化比较传统的这样子一个呃,300指针的一个多因子回撤等等啊的一个一个情况。那从通过这三个希望说通过这三个案例吧, 00:11:11 去覆盖我们平时的一个呃金融投研里面啊,不同人群的一个一个一个情况,然后去测试说我们这样子一个大模型的一个能力的一个情况。那首先第一个的话,任务的话就是去我们去做我们的一个估值模型这块的话,我们呃写其实三个任务都是我们去完整地写了一个。就是提示词,然后通过一次测试的一个呃尽可能一次测试吧,因为有的时候可能呃模型它会掉掉链子,然后那我通过一个完整一样的提示词,然后喂到给我们的3个模型,让它去 输出它的一个结果。那我们去对照它的一个结果的一个输出的一个质量,完成度等等的一个角度的话,去对他们三个模型去做我们这样的一个综合打分。 00:11:58 那关于估值模型这块的话,其实我们是呃让他去以中期去创去研作为这样子研究目标对吧?然后要求模型去拿通过我们的数据库去拿我们的历史财务,还有说经营数据,并且去建立我们这个经营预设,去搭建我们的一个三大报表的供机关系,去构建DCF以及做相对估值的一个模型。并且要去输出我们这样的一个敏感分析的一个价定分析,以及说投资报告。那呃这块的话就是呃我们的一个大体的一个任务的一个需求啊,当然整体的一个流程啊,提示词的话可能会比这边会多很多,但是呃是让他去做这样子一个任务。 00:12:34 那关于这块的话,这个估值建模还有说分析的一个模块的话,Kimi K3的话整体上来说是呃完成了我个需求。包括说我们把我们估值底表需要的这样子一个十个工作表,包括说覆盖我们的封面核心结论、关键假设、历史财财务啊经营预测、三大报表DCF估值相对估值敏感分析、统计分析等等的,它其实都完成了我们的一个任务,然后。 00:12:59 的话也就对于呃去预测方式的话,也对我们的公司的它的一个公司的一个收入的话去做了拆解,800G以上的光模块,400G的光模块的和其他的一个产品,然后去分别去拆解说它不同居不同产品的一个销量和单价。对,所以但是的话就是有一个问题就是说啊,它的这样子的一个没有去冲他的一个。预测的一个逻辑里面,没有去说明这样子一个销量和单价的一个假设的一个具体依据。那只是以这样子一个产品放量和