您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:光大资产配置 首发Kimi K3投研能力实测 - 发现报告

光大资产配置 首发Kimi K3投研能力实测

2026-07-23 未知机构 匡露
报告封面

00:00:02 特别声明,本会议为光大证券专业机构投资者设计,任何情形下会议内容不构成对任何人的投资建议。参会者应当充分了解各类投资风险,根据自身情况自主做出投资决策并自行承担投资风险,嘉宾发言内容仅代表嘉宾的个人观点和立场,研究人员发言内容来自于以外发报告或对研报的跟踪解读,观点仅代表报告发布当日的判断。本会议内容的知识产权仅归光大证券所有。未经书面许可,任何机构和个人不得以任何形式、任何目的进行转发、翻版、复制、发布或引用会议全部或部分内容,亦不得擅自录音、制作会议纪要对外传播。 00:00:57 好的,各位领导大家下午好啊,欢迎大家来参加今天下午呃,光大证券和商显科技联合举办的呃kimik3的投研能力测评报告啊。 00:01:08 那么呃众众所周知,在最近的这一周时间里面啊,除了WST大会以外啊,Kimi K3的横空出世,让资本市场对这个中国又一次的DeepSeek时刻展开了充分的探讨啊。无论是它对呃美股AI行情的影响,还是它对我们AI投研界啊,应该说都是呃比较重要的一次变革啊。那么呃我们这个上线科技冰洁总团队呢,也第一时间在市场上做了相关的团研能力的测评啊。我们今天也非常有幸请到了冰杰总这边啊,也是各位就是熟悉AI投研领域的这个呃领导们的老朋友啊,跟大家第一时间展开相应的分享啊。那话不多说,把时间交给冰杰总就行。 00:01:49 哎好的好的,谢谢王凯老师啊。今天很高兴给大家分享一下呃,我们商景科技对于kimik3投研能力的测评。那么相信大家对kimik3的这个能力啊,最近这段时间其实发酵的也是非常的这个剧烈啊,因为K3确实是一个非常强大的模型,然后呢,而且现在因为呃这个Kimi可能他们的算力之储备这边还是略有不足啊,所以现在是这个呃一票难求。想用Kimi K3的人非常多,但真正能够呃这个规模化的用起来的还是偏少一点。那么我这边 呢,今天就从这么几个角度来分别展开讲一讲,K3的这个能力究竟怎么和投研这边做结合,以及我们商显科技团队对K3能力的一个呃测评。 00:02:32 那么关于K3的一个基础信息我这边就不多赘述了啊,我简单的说一下有几个值得关注的点。 00:02:39 第一个呢,呃K3应该来说是目前全球参数规模最大的一个开源模型,那么呢它的总参数量是2.8万亿啊,它的架构用的是。混合专家就是大家熟悉的MoE架构,一共有896个专家。那么推理时呢会同时激活16个上下文窗口呢达到百万级,也是100万token的一个上下文窗口,同时原生支持视觉理解多模态。那么按照它的计划呢,会在7月27号之前,也就这两天呢会进行一个全面的开源。 00:03:09 那么这次K3它的一个技术架构啊,有几个核心的创新,大家可以关注技术的朋友可以再去了解一下啊。第一个就采用了他们自己的呃KDA混合线性注意力机制,能够让信息在更长的序列和更深的模型里面做比较顺畅的流动。那么第二个呢,还是用了残差注意力机制和KDA一起呢,构建起了一个Kimi的K3的核心骨架啊,然后同时用了它的stablelatent的MoE框架扩大了MoE的稀疏度。那么在896个专家中呢,高效地激活对应的16个专家。那么这一些呢,是它相比上代的K2模型的一个比较重要的几个创新,那么使得它的K3整体的扩展效率呢?有了一个大幅的提升, 00:03:50 那么最近在各种测评的benchmark上啊,能看到它在呃前端编码上的能力呢,其实是非常非常强大的,可以说是超过了fiable5还有GBT5.6,so这两款最强的闭源模型,而且能够稳定地超越其他的模型。那么呃在这个方面其实也给华尔街带来了很大的冲击啊,我看最近其实相关类似的报道啊,在中美其实都非常多。那么呃具体到我们行业中,其实我们更关注的啊,是Kimi K3能不能在我们投研场景中去,呃得得达到一个比这个其他模型更好的效果。 00:04:22 那针对这个场景呢,我们做了一系列的专业测评啊, 00:04:26 首先我们先来说一下测评的结果啊,那么结果我就直接放在这儿了,其实我们有一个专门的测评的这么一个结果页啊,这个呢大家我们可以简单看一看。一会儿我还是回到我们的PPT这边来看。其实如果真的看的话,应该调后台的这个呃原始的markdown格式的文件给大家看啊,但是因为时间有限,我这边呢还没有把它真正的做成一份PPT材料。材料更多是一个呃数据分析的结果, 00:04:52 所以我今天呢结合着这个数据的一个信息啊, 00:04:55 然后我们挑选了几个重点的案例,给大家做一个做一个这个这个数据的分享。 00:05:02 好,那么可以看一下这个呃结果。我们这边呢有一个比较定性的判断啊,就是Kimi的这个K3模型应该来说它在时效性上和时效判断上,在证据的边界控制上,还有前提纠错这么一系列对投研比较关键的一些重要维度上,表现都是特别的突出的。它的多项得分呢,应该来说是呃,在一些项目的得分上其实是要超过了GBT5.5和open4.8的,那么整体的推理能力呢,应该来说是进入到了第一梯队的能力上面。那么这是我们的RRB测评集上,那么Kimi K3对于各个维度上的一个综合评分的情况,可以看到它仅次于fiable5,然后呢,比GPT5.5还要更胜一筹啊,这是我们八个重要的维度的得分。 00:05:50 那么大家可能好奇,就是我们这个测评是怎么怎么做的啊,就是我也可以给大家呃很坦诚地说一下我们测评的一个方式啊。那么呃,我们的测评背后依赖于的是我们商检科技自己建设的一套测评。评级叫做IRB,IRB的全称呢叫做investment research benchmark投资研究测评级。这个测评级它的这个意义我觉得是比较比较重大的啊,因为呃,我们投资研究场景的一些用户的真实的问题,相比于这种公开市场的这种呃日常C端的对话来说是要深度得多的啊。我这边给大家看一些实际的一些问题,大家就能感受得到啊,这边我举了一些例子,一会儿我也会举这些例子给大家看一下, 00:06:31 Kimi K3的一个回答的一个呃特点。比如说这是我们客户之前提过的问题,说诶某某公司啊,安吉科技在25年上半年半导体抛光液占比百分之五七十二,那么CR5是这么一点。那么呃,结合未来半导体抛光业价格下降的一个预期,那么会对它的一个净利润产生百分之多少的冲击?那这是25年的问题啊,所以说是一个25年的一个一个一个语境。那么同时像中芯国际扩展这次调整可能会带来多少的坏账准备?那么这是一个课。 00:07:03 客户的真实的问题啊,那么我们这个测评级怎么来的呢?本质上是因为有很多很多用户在我们的offerphaengine上面去提一些问题。那么提问之后呢,我们这边呢呃结合用户有一些问题他会回答得不是特别的好。比如说用户对回答结果不满意,我们的同事会和客户之间进行一对一的沟通,通过授权的方式呢得到这个错题集的授权。 00:07:27 那目前经过这么一个错题的整理,我们现在的RRB测评集已经有了呃大几千近万套,近万题的这个投研的呃易错题或者难题的这么一个集合。那么这些题目都是在去年或者今年有一些模型回答的基本不太好,那么我们看一下呃新一代的新生力量的模型能不能回答得更好啊? 00:07:48 是这样的,所以说它对于投研能力的测评来说应该是呃,应该是应该是有着比较标杆性的一个测评意义的啊。那目前呢,我们的这个测评集呢会从财务分析能力、定量分析能力、陷阱问题等等我们会。 00:08:03 就从18个领域分别呢去衡量相关性、有用性、流畅性、连贯性、一致性这么一些维度做人机双盲评分。 00:08:10 什么叫人机双盲评分呢?就是我们一个回答结果出来之后呢,我们会用现在市面上大家公认的最强的模型,会先做一道这个结果的测评,我们会有一个标准答案,去评估这个标答和大模型回答结果之间的一个偏离度。那同时呢,我们商检科技内部啊有一个专家测评团队,我们会有专家团队进行一个人工打分,最后呢,人机结合进行一个双模评分,得到一个最终的结果。因为测评的这个问题的数量就比较庞大了,所以说目前最终的结果呢,质 量还是比较高的,也得到了业内的一致认可。那么这是目前的一个综合测评结结果,我们可以看一下评分。 00:08:45 那么综合来看呢,Cloude fiable5还是现在结果最好的模型,这个确实没有争议啊。那么总分在我们这儿得到了达到了94分,那么GPT5.5啊,综合排名排名第二是92点啊36分,那么K3呢是排名第三九十分应该来。 00:09:03 说是现在国产模型中的能力最强的模型,那么同时这个模型的能力呢,是超过了大家现在用的比较多的像OPPO4.8啊,像Gemini3.1Pro这么两个模型的一个能力。同时大家可以看到,单任务的花费成本相比于fiber5应该来说是显著下降的啊,1.47而FIB5的是8.4GBT5.5的是3.2。 00:09:26 虽然说现在大家用K3觉得哎呀这个用着用着额度就花完了啊,但是我觉得这个是暂时性的一个问题,因为呃Kimi确实整体的算力可能更多的是倾向于训练模型,那么在推理端并没有储备太大的算力。我觉得这次K3这么出圈,其实也是也是也也也是可能在这整个计划之外的一个自然现象啊,所以说现在随着K3的一个基础算力扩容,我觉得未来这个成本在整个行业中还是非常能打的。 00:09:55 好,这是我觉得整个行业中大家值得关注的一个呃基本参数的现象。 00:09:59 那么同时呢,我们对于现在K3的能力呢,从这么8个维度进行了一个深度的二阶指标的打分。那么这里面包括上下文的忠实度、事件的一个还原的准确性、金融问题的一个回答专业度、推理深度、指令遵循能力等等等等,做了一个分项打分,可以看到它在各个分项上啊其实和Fi包5和5.5的基本上不相上下。那么相比其他模型呢,有一个比较稳定的一个呃一个一个一个提升啊,这是目前的一个测评的情况。 00:10:29 那么同时呢,值得注意的是,我们发现啊,在测评过程中有一个很明显的感受,就是K3模型在推理链条的一些关键节点上,表现出了更强的一个纪律性啊。具体有什么有有几个 特点,我一会儿会结合案例给大家做一个介绍。 00:10:44 第一个呢,当你在嗯引用做投研问题问答的时候啊,经常会用到呃各式各样的信息来源,比如说当一个财务指标或者一个呃。呃,一个一个产业链的一个关键信息存在,不同来源的信息有相互冲突的时候呢,我们发现啊,Kimi它的K3模型经常还是会能够从中锚定一个最新的事实,不会被过往的一个过期的数据去拉偏结论,这是我觉得挺关键的一个性能。那第二个性能是在于当信息不充分的时候,缺乏证据缺口的时候, 00:11:17 K3它不会通过幻觉的方式啊来填补因果链,这个也很重要。因为以前的模型啊经常会出现这么一个问题,就是当没有找到一个明确的推理链路的时候呢,他不会回答说我不知道,他会自己填充一些信息啊。这个在个人C端问答的时候可能无无无所谓啊,但是在B端专业场景问答的时候呢,是一个非常重大的问题,可能失去呃做了一次这样的一个因果链的一个幻觉填补,可能用户就失去了信心,然后就不使用了。 00:11:44 这一点上我觉得K3做的是特别突出的,它有更强的纪律性,不会随便地用幻觉来填补因果链。 00:11:51 第三点就是我们发现啊,当用户我们有些用户可能。在输入问题的时候啊,它有时候一些呃数据或者前提是有错误的。我们我们发现kimik3在回答的时候呢,他会经常性的去主动做一些数据的核验,当用户有错误的前提的时候,他会先指出再做解答,而不会非常呃顺应着用户的一个假设,基于错误的假设往下推导,这我觉得也是非常不错的一个性能。 00:12:19 那么同时当多个机构呢存在观点分歧的时候呢,他也可以经常性地去提取共识去标出分歧,不用模糊的共识呢来回避矛盾,这我觉得也是比较有有价值的几个点啊。 00:12:31 那么接下来呢,我这边结合一些呃实际的题目,我们来给大家讲解一下K3的一个真实表现。那么我看一下这个题目的一个位置啊,这是我们测评的一个完整的一个测评级的结果