您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:西部计算机详解Kimi K3 - 发现报告

西部计算机详解Kimi K3

2026-07-20 未知机构 章嘉艺
报告封面

00:00:01 大家好,欢迎参加西部计算机详解kimik3。目前所有参会者均处于静音状态,下面开始播报声明。本次电话会议服务于西部证券研究所客户,不构成投资建议。相关人员应自主做出投资决策并自行承担投资风险。西部证券不应使用本次内容所导致的任何损失承担任何责任。专家发言内容仅代表专家个人观点,不代表本公司观点。本次会议内容不涉及国家保密信息,内幕信息、未公开重大信息、商业秘密、个人隐私,不得涉及可能引发不当炒作或股价异常波动的敏感信息,不得涉及影响社会或资本市场稳定的言论。 00:00:42 未经西部证券事先书面许可,任何机构或个人不得以任何形式复制,刊载,转载,转发,引用本次会议内容。否则,由此造成的一切后果及法律责任由该机构或个人承担,本公司保留追究其法律责任的权利。 00:01:03 啊,各位领导晚上好,我是西部计算机的谢晨。呃,借今天晚上的时间,我们一起来对Kimi最新的这个旗舰模型K3啊做一个深度的解读。呃,那么上周五的凌晨,Kimi发布了旗舰大模型K3啊,总参数量是达到了这个2.8T的量级啊,成为全球呃首个开放权重3T级的一个模型,跟DeepSeek一样。呃,K3呢也拥有100万上下文的能力以及原生多模态的能力,同时呢在当当下呃市场最关注的coding能力上,呃K3也在这个最有影响力的code arerena的榜单上登顶。这是中国模型继DeepSeek R1之后啊,再次在从coding能力上呃实现了追赶甚至反超的海外模型。 00:01:50 呃因此呢,K3的发布也被称为这个DeepSeek的2.0时刻啊啊,那叠加呃最近谷歌的这个Gemini3.5Pro的这个跳票啊,那国内的前沿的模型呢? 00:02:03 力进展和格局以及K3模型架构,包括他们自研芯片,还有K3对于国内外算力存力的影响,呃再次引起了市场的广泛关关注。 00:02:14 呃,今晚呢,我们很高兴地有请到了这个行业内呃资深的大模型专家,来对以上问题来进行解读。 00:02:22 呃,那专家您好,能听到吗?嗯,可以可以,你好,哎好的。呃,那这边我就先请教您几个,也是市场最关注的几个问题啊。那呃,第一个问题还还请您对于Kimi的这个K3模型啊,有哪些技术创新呃,为何能够实现这种长下上下文多模态和扣底能力的突破,呃,还做一个解读啊。当然就是他们的那个呃,完整的权重和技术paper可能要到一周后才会发布啊,就从现在呃您了了解到情况,呃,麻烦您对于他的呃这个呃这个技术创新来做一个解读啊。 00:03:02 呃,我觉得就是一个核心的一个点,就是呃这个896这种专家的这种吸收网络啊,这属于超级吸收的网络,可以在这个呃ME ME里面可以去稳定的训练,这个是全球第一啊,目前呃还没有其他家能做,我觉得这一点呃比较重要,而且这一点它是。 00:03:24 过去大家都想着说我这个代码模型我是单独做一个,呃,我其他模型单独做一个,但是Kimi这次把这个。呃,原生多模态跟这个代码级的这种固定的这块儿啊,做了一个很好的结合啊,所以我觉得呃,这两者之间是起到了一个协同,就是说我做了一个。超大型的模型。然后这个模型还非常稀疏。呃,2.8万亿参数,然后每次还只激活这个,呃百分之不到2%左右的一个专家数量啊就这一点,呃体现的就是说我们国产模型就是说在这个。呃,从模型到这个coding agent啊,到整个这个推理架构系统之间的这种协同设计能力啊, 00:04:11所以我把这个作为呃第1点来说,然后第2点就是说他在这个。 00:04:19 模型的网络架构本身啊做了几个嗯,比如说几个有意思的事情啊, 00:04:25 就是第一个是它那个呃,这次它着其实着重体现的是叫长城任务啊,它并不是说要。在一些这种。呃,通俗意义上,像这些理解这些任务上啊,它更重要的体现出这个模型要求的是说,我要做一个呃长期,我不需要人类去交互。啊,然后我自己这这个这个无人值守的情况下啊,我能不能稳定地去工作啊,所以这个模型它。在最高分数上啊,最高的分数上啊,现在目前达不到这个全球呃最高也就是极限分数不是最高,但是它的中位数分数,也就是说这个模型的稳定性。啊做得非常的高啊, 00:05:08 目前呃整个在这个科定这个领域啊,在在这个呃稳定性这块,可能大概能够排到一个呃在全球能排到前三名这样的一个水平。啊,这个也是实际上,呃,这个日常大家这个在使用模型里面啊,其实更看重的是这个啊稳定性,就是我。不因为用户的这个啊prompt或者说用户端的协助啊这些变化模型自身啊,在这个纠错方面啊,在这些呃理解包括细节处理以及这种事业知识这个领域,就这种更好的呃理解能力带来了这个模型自身一个更好的温度稳,明显就是这种更。自适应的一个思考能力啊,就是长期自主智能体的稳定性啊, 00:05:56 就这一点啊,那么它对应的就是在网络层面做了两件事情啊, 00:06:00 第一件就是把这个网络。呃,就是做的啊。把深度啊做得更好啊,正常在长城任务里面。这个百万上下文场景下,而且是长时间工作啊,其实它涉及的上下文可能啊,都会超过500万的这个这个这个KV开启的这种上下文。啊,怎么把这个最先的这个摄像文跟最后的这个上下文之间啊,去做一个很深层次的一个连接啊,就是它那个KDA。 00:06:29 KDN那套网络啊,就这个这点是比较呃是比较核心的一个东西啊。就是它这个解决在这个深度长生热文下啊,这个进行长程任务推理的时候啊, 00:06:42 一个是成本问题啊,一个是本身这个推理效果问题啊,这这个是这是在这次一个很关键的一个技术点啊,另一个就是。 00:06:53 嗯,模型在刚才说的是深度上,就是模型我越跑越深的情况下,另一点就是说模型呃那个刚才是序列长度上,就是模型的这个长token序列下的这个问题可用这个KDA a解决。那还有一个就是它一个有一个attention呃有一个attention这个残差网络啊,它解决的是一个宽度上的问题,就是啊模型去。在这个网络在不同的层啊,相对说在不同的这个呃这个宽度上啊,去进行一个信息流的一个嗯一个计算啊,这也是保证啊,这个这两者应该是起一个协同作用,保证这个K3这个模型啊当它从。 00:07:35 千亿级模型拓展到万亿级参数的时候,这个上下文拓展到百万上下文的时候,也能有一个很好的这个训练中的稳定性以及这个。 00:07:44 推理的能力啊,我觉得这个这点是。嗯,是比较重要的,就这两者之间是嗯这个合二为一的啊,然后大概核心的。 00:07:58 呃,核心技术应该是,呃,是这些,其他剩下可能是一些补充的像。呃,像这个。比如说这个门控机制。啊就是来呃这个非常吸疏化啊,就是通过我们共机制啊,它有个叫D体的MNA这个技术啊,来提高这个呃注意力的一个选择性啊,这是呃当然这个东西它是一个改进啊,并不是这次呃直接提出来的。啊,剩下就是像。嗯,一些激活函数啊等等啊,有这这些小的改进,我觉得就呃就可以,我就就不用说了,更重要就刚才那两层网络啊,以及这个极端的这个稀疏化。阶段系疏化这个非常重要啊,这一点啊也是确保说他最后呃能对这个算力啊,就是啊有一些这种啊比较好的一个利用。啊,大概是是这样。啊好的,那个明白。 00:08:59 然后专家我这边再补充一个问题啊,就是刚才您讲到了这个K3可能是个原生多模态的,跟可能很多之前呃其他的一些国内外模型做。比如说你做个模型,然后再外挂一个多模态模型,它可能是分开训练的,但是它结合到了一个系统里,就体现到了一个多模态能力。但是K3呢可能是一个端到端的这种原生的一个训练的一个模式啊。那么它这种呃原生的训练多模态,和我直接外挂一个单独训练多模态上面,在训练包括数据啊和方法论上面就 是大概有什么样的不同啊,可能大家呃可能比较关心这个问题。嗯, 00:09:39 在训练端是这样,训练端呃,原生动作态需要就是你在训练那那个那一刹那那一瞬间。呃你就要将这些不同的呃这些数据啊,就是比如说代码里的这种代码数据,然后文本数据,呃包括说像呃图片数据等等等这些数据,包括Kimi比较擅长的像嗯金融等等方面这种时间序列数据,就是它是从这些维度上的数据。啊,在训练端就一起去放进去啊,而不是说正常的我们讲。 00:10:14 现在外面的一些模型啊,就是有时候它也混在一起,对外也可能会呈现出这个模型,既能编程序,呃,也能具备这个视觉理解能力,而且等等这类模型也有,但其实它是分开的啊, 00:10:26 比如说它的图像理解可能是通过一个。OCR啊去解决啊,那Kimi是将这些所有数据呢啊通通去嗯放在一起啊,在在包括像一些啊前端的游戏的啊这个这个一些图片的。啊,还有像我先看像一些空间的CAD等等这些数据啊,它也是有的,就把这些数据呃放到一起,然后它呃为什么它能够训练呢?啊,它里面896个路由专家。啊可以不同的专家可以去呃学习这个代码数学视觉知识等等啊,不同的模式啊,然后从而提升这个呃我这个单位专家啊, 00:11:10 我到底能够去捕获到哪些领域的这种呃智能的数据的这个水平啊,是这么做。所以说它是一个混合形式的啊最后这些数据进到这个网络里面来。啊,全部统一都变成向量,就是这个向量的这个维度啊,包括说这个向量本身的这种稀疏化程度啊,是不一样的。啊,他是这么去做,就核心就是在输入端。我有一个这个。多向量计算的机制就是无论你来的是什么样的数据。啊,在我眼里我都是一样的,我我给你去起一个融合,啊同时他这种方式呢。 00:11:47 就需要对数据有一个非常好的这个量化压缩功能,就是嗯,你得能很清楚地知道。哪些数据是非常重要的数据啊?哪些数据是噪音啊?因为越是这个,如果说我只是一个单模态数 据,那还好,我就设一个专业专业的网络去做。 00:12:06但我如果是一个嗯非常复杂的这种这种网络对吧,那我对于数据的要求就比较高了啊,你怎么在这种, 00:12:13 你这个可能有超过30万亿级的这个数据,怎么在这么多数据里面?啊我去呃,这个在每一轮的训练里面,去为每个每一次这个不同的专家去给他去挑选出这个啊,压缩的最好的数据啊, 00:12:28 就是数据压缩这个功能应该是Kimi在刚推出来的时候, 00:12:32 其实它啊当时就很擅长这块的一个功能。因为当时它是以这个啊长三角文著称的一个模型,所以这点我觉得是他的一个。嗯,老本行啊,就是说对数据的一个呃极限的压缩啊,这一点我觉得嗯是确保说呃我在网络架构设计的对的情况下,我也能够去。啊,这个让这些数据去啊能够收敛的去训练啊,我觉得核心呃核心是这些啊,所以对外呈现的时候最后就这个模型嗯,他在做。他在看到视觉的时候。啊它其实已经能够根据视觉去推理,就是视觉也具备这个啊,像文本一样这种CT的推理能力啊代码呢就不更不用说了啊, 00:13:16 就有保存这样的一个功能。嗯,好的好的,了解, 00:13:21 呃那呃训练一个原生多模态就是专家您就是问一下结论啊,就是训练一个就原生多模态,它的这种对于网络啊或者存储数据的要求,会不会比一个单独训练拼在一起的模型要大呀? 00:13:36 就从训练的角度来看。对,从训练的角度,嗯,他会需要一个更加大的模型,然后更加多的数据啊,这个是嗯,这个是需要的。嗯,好的,了解。 00:13:51 然后第二个问题就是呃这个Kimi K3啊,其实也看到了他从评分上面可能都呃在某些领域上啊,包括coding arena的那个呃榜单上面其实都超过了这个海外的这个fiber5啊。那可能呃就是大家也在关心啊,就是Kimi的这个模型实现了一个国内模型的一个SOTA a的一个水平,然后又实现对海外的反超,那么这个格局啊,就是特别是国内外的格局,呃, 00:14:20 您是怎么看待这个变化的啊?嗯,国内外其实整个这个。嗯,这个这个变化是我我我我个人觉得肯定会对。呃,像对一些这个像是像像类似于cloud的这样的啊,就是这种嗯高价的地源模型啊,其实会形成一定的一个影响,因为现在呃Kimi的价格应该大概只有它的一个,如果算呃算这个没有命中这个缓存的情况下,它价