您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:国泰海通计算机KimiK3解密28万亿参数之后 - 发现报告

国泰海通计算机KimiK3解密28万亿参数之后

2026-07-17 未知机构 Bach🐮
报告封面

嘉宾3 的旗舰款,16年是1500对单。正式成为首个面向开源社区开放的 嘉宾2 3万亿的一个参数的大模型,目前的参数量是达到了2.8万亿。然后上下文窗口是在百万上下文,然后整体这个完整的权重会在7月27号之前开源。那它的核心架构上是有很多创新的,包括MoE架构,它是在接近900个专家里面,高效地去激活16个。相较于它之前的上一代的模型,整体扩展效率是提升了差不多2.5倍。然后它的定价毕竟3万亿参数,它定价确实有所提升。相较于飞博5的话,它的整体定价水平是在飞博5模型的3分之1。这样一个水位,具体就是输入价格20,然后输出价格100人民币,每百万token。但它现在系统表现也是非常夸张,让整个社区都感到非常振奋。它的综合性能水平是位列全球第三的,在一些细分赛道是对这个Claude 5还有GPT-5.6实现了反超。所以说现在全球产业链也迎来了一个比较关键的节点。海外现在正在演绎这个token通缩,或者说模型智能水平到Tier 2模型能力的商业化价值通缩的这样一个逻辑。今天我们也是非常荣幸邀请到产业界非常资深的专家向总给我们解读。包括K3的底层的一些技术路径,还有它的成本结构,包括它的这个定价策略,以及这个开源模型对全球大模型迭代和商业化的一些冲击。首先向总,感谢您的参与。 嘉宾3 请您从K3的架构创新 嘉宾2 还有工程实现这个方向去展开介绍一下。 嘉宾3 好的,这个模型它其实主要是在这个首先是网络架构上,过往的话主要是这种长程任务会偏少,这也是这次K3模型最为重点强调的一点。就是说在这种长程的复杂任务上,并且也特意提示了,如果说你用这种智能体框架去接不同模型的时候,那么它这个模型可能会失效。就是它比较依赖于这个历史的上下文信息,没有这个的话,它的长程任务可能做得也一般般。 这个主要是在后训练阶段,是用了这样的一种方法,这个长程任务是它的一个亮点,然后 体现在这个技术里面,那么对应于这种长程的任务,首先就是我就要去做一些这种更深度的这种信息的连接。就过往我可能比如我模型20万上下文,然后我一个任务可能需要耗费50万上下文,那么我可能每一个小的这个模块,每个小的这个模块里面可能它就20万上下文。这个时候过去它的像K206等等这些模型,就是你在20万上下文以下,它是能够去记得第一个token跟最后token之间的这种深层次的关系。那当你现在在长程任务里面,你的上下文扩展到100万的时候,我怎么让这100万上下文能真正地发挥它最大的效果,我要做一个更深层次的连接。就是我确保我第一个token出来的时候,以及跟我最后token出来的时候,他俩之间还是依旧能够有一个很强的这种绑定能力。 也就是说这种深度信息的这种能力。这个能力它其实是通过早期何恺明提出了一个技术,就这个当时叫ResNet这个网络,它叫残差网络。他把残差网络这个思想用在了这个attention这个注意力机制上。从而保证说Kimi K3这个模型,这么多的专家,然后这么大的一个模型,然后在这种很长的任务上,他依旧能够记得这个,能够比较清晰地记得说,就不会出现说做新的任务,忘记前面的任务。所以这个我觉得是一个这次他面对这种任务的特色,做了一个比较新的一个点,当然他下游任务,这个时候可能就不局限于说只有代码的,我们看到他在这个办公场景,这些Word以及PPT场景下,效果也不错,这是一个比较核心的一个点。 还有一些点就是在这个MoE架构上就做了一些东西。MoE架构是一个从24年大家一直在琢磨到现在。目前Kimi这代MoE它的这个专家网络专家数量,也是全球专家数量做得最多的。这也是我一直以来一个观点,就是说我在24年应该就当时也这么认为,就说当时是32个64个,会往后一直拓展。当时在目前的技术评价,当时我说的是大概能拓展到1024个左右。目前看经过一年多不到两年的时间,Kimi把这个MoE专家数量往前拓展到接近1000个了。也就是说这种非常稀疏的这种专家,它其实里面拓展核心是你要训练出一个被你调度的专家越多。那你中间这个类似于交换机一样这个东西这个调度,路由器,你怎么去均衡式地你去思考,去用哪些专家去解决具体的问题,所以这种对于这种技术专家这方面的探索,这个Kimi也往前走了一步。 然后还有一点就是在这个算是模型量化与训练上。过往的话它会偏向于我先用16比特这个东西去训练,我后面再去事后再去压缩。那么Kimi这次的这个K3这个模型,它是我在SFT阶段,我就用这个MXFP4这个权重,当然有FP8的权重,互相去混合去训练,这样的话它能确保说对国内来讲,我一个2.8个亿参数的模型,我也能在一个有限的,相当于是相对国外来说真的有限的算力下,实现这样的一个训练。而且在推理端,我这个能够比 当然比国内模型目前贵一点,比国外模型大概能够便宜个可能是它的一个3分之1左右。这是一个从这个单价,从成本端他去考量的一件事情。我觉得这几点是比较核心的,他在这个模型的这种一些单点的一些创新。 嘉宾2 好的,感谢向总。然后就是关于刚刚咱们提到那个问题,它这个开源跟中美大模型前沿模型的差距已经基本上在六个月以内。大家就担心它这种顶尖的闭源模型和开源模型的差距会被进一步拉近到两三个月。那这个对于闭源模型的商业化来说就是比较危险了。之前大家给顶尖模型的商业化价值带来的高溢价,给的这个估值这个趋势可能就不太撑得住,那就引发这种frontier模型的token通缩,您对这个是怎么看? 嘉宾3 这点是这样,就是国内肯定是目前在K3发布前,国内这个前沿模型离国外大概是一个半年到9个月这样的一个差距的情况下,然后我们想占领全球这样的一个心智。其实如果你说不开源,你是无法走到这一步的。所以说对于我们来讲,这也是国内这几家为什么都通通地往这条路走了。就是你必须得说叫你在能力不够的情况下,你不得不去开源。然后让全球去在你这个模型上去添砖加瓦,包括说开源的话也是能够将用户先这种形式,先让他进入到我这个模型的生态圈子里来。因为用户用的时候,他会发现,这个模型可能跟Kimi自己的这个Kimi Chat结合起来会要更好一点。如果Kimi也推出那个,后面会推出这个,它跟企业版类似于企业版的这种Kimi Code,就是说横跨企业业务流的。 虽然我模型是开源的,但是你想达到好的效果你是不行的。所以说开源模型能,但说前期以这种比较低的这种成本的形式,我去将这些C端的包括B端用户先吸纳过来,然后我再就同样一个模型,你不同的这些企业,你这些用户,他可能不太可能去自己部署。因为他自己去做的情况下,第一个就是说C端肯定是不太可能的,因为这次这个模型对于这个算力还是有一定的要求的。 然后B端对于这种新的算力形态,官方也建议了,是接近超节点的这样的一种算力形态,跟之前早期DeepSeek提供的思路是一样的。在这种形态下,其实很多企业你未必能玩得转。就是你同样你就算买了这样一套硬件,你去部署,你可能也达不到一个这样好的一个效果,所以我认为开源是当下促进大模型更快的从有这么好的一个效果去往这个应用端去渗透的过程。 相反我觉得其实在通往AGI之前,我觉得各个企业这种方式,尤其国内这些企业,其实还挺好的。其实我觉得能够加强他真正的ARR这些数据。因为你其实靠C端这些订阅,它这 个东西,其实很难有一个在目前国内这样一个付费的,这样他这个ARR很难去提升得比较快。但是B端这个付费意愿各方面,包括它的业务场景,它其实这块它提升得比较快,就参考国外的这个Cursor,所以Kimi这次是对Replit这些东西。但是他同时也在积极地去做面向B端的这样的一个Agent的框架。所以我觉得这块才是一个比较核心的趋势,去提升企业工作端的这些价值。我觉得这样会更适合我们目前模型相比国外落后的这样一种情况。因为其实国外模型它并不是说是到像Claude Opus这样的一个水平,它其实下个阶段模型也会马上出来。并不是说这次这个K3发布出来之后,我们就离国外可能无限的接近,其实目前综合能力上还是有一些距离,大概是这样。 嘉宾2 理解。向总他其实海外对于这个通缩,大家不是说认为中美的这个差距会在短期缩减到基本上是开源模型完全可用,就顶尖边缘模型它的溢价趋近于0。不是说这样的,而是大家会提前演绎一个预期,就是在模型能力撞墙,就至少从目前coding这个场景,它如果到达一个非常高度可用的一个专家级水平的情况下,然后ES比他率先到了一个模型撞墙,或者说迭代速度收敛的这样一个境界。那在那个时候,如果说中美或者说必然和开源模型的差距在2到3个月时间,相当于开源生态再等2到3个月就能实现对这种双TI模型的一个追赶。所以说闭源模型的商业价值可能就会被虹吸的非常严重,您对这个趋势怎么看? 嘉宾3 我觉得他肯定会受一定的影响。如果说从国内外去对比的话,就是现在国外也有这样的一种趋势,就像这个Cursor等等这些模型和这些AI框架,其实现在也在接入国内的像DeepSeek的这个之类的模型。就是我认为国外它是朝着一种。 我认为国外其实是朝着一种让这个模型去往这种更高阶梯方向在走。它目前还是这种思路,就是并不打算去往更低的价格领域去竞争。而且他们有他们的这样的一个适合的一套路径。因为其实就我看来,国外模型它的这个收敛速度并没有放缓,它不太可能在短期半年一年内说这个速度会放缓。相反他们现在模型的进展速度其实是在加快的,原因在于整个大模型的训练这块,他们似乎找到了一套让模型去自我训练的这样一种思路。当然目前还没有对外发布完整的这个东西,但是我认为大概在今年,他们可能会发布关于模型这方面,一个是完全自我训练,另一个是这种比Kimi现在还要长的任务,就是这种超级长的能一下子在那儿自己工作几天的,到时候会发布关于这两方面的技术。当然可能是模型小版本的更新,也有可能我个人更倾向于可能会发布这方面的技术报告,从而告诉大家说在模型的竞争上,我们的速度是在加速的。一旦完全掌握了这个模型的自我训练,其实我们 国内目前在还没有完全掌握的情况下,其实他们会比较快地去往前走。 所以我觉得这是模型后续的一个一个发展思路,也介入这种思路,整个大模型会出现很多更好的一些东西,就像kimi这次这个模型去设计芯片一样,后面会出现可能我们都很多想象不到的,各种功能场景就出来了。所以我觉得这个问题似乎现在外面的担心我觉得可能会稍微有一点多余。但当然这个短期的担忧我担心我觉得是正常的。但是从大模型本身现在业内这个研究的进展来看,因为可能他们对这方面没有更深了解。就是研究进展来看,其实这方面中期来看,就是我觉得可能是半年以后,总体来看,这块这个担忧会会消解掉。就是关于这个必要模型的商业化这方面,我我这是我的一个观点。 嘉宾2 了解,感谢向总。然后我们再回到K3本身,您觉得这一次他技术的突破主要有哪些核心驱动因素?首先是这个底层一些技术路径,想请您稍微做一些详细的分享吧。关于它这个KDA的线性注意力,注意力残差,还有您刚刚提到的这个SFT阶段的量化感知训练,还有包括它这个Mooncake的一个分离式推理与架构,对他这个编程场景的缓存率的提升,可以稍微给我们具体分享一下。 嘉宾3 行,他这里其实有很多很细的技术,刚才那些是相对来说比较核心的。你比如说他那个KDA这个技术,这个也是Kimi自己提出来的。它相当于这个技术是用来决定这个,同样大家都去做100万上下文,谁能把这100万上下文用这个成本做得很低,那么这个KDA技术加上它这个MLA这个混合推理这个技术,这两个技术结合,它是确保说我们都在做100万上下文的情况下,我的这一版本上下文能通过这个技术让模型去记住更多的序列,就是相当于说我让这个成本会更低一点。然后你像整个专家并行这一块,业内是没有说能做到896个这么多专家,Kimi是一种比较叫全平衡的这种专家并行的这种思路,能确保说在一些关键路径上,它的整个专家的调度上,能够去用一种更快速的调度。那对应的他在推理中也提出来了,他这种思路是不太适合去,不太需要在传统的这种GPU部署的机器上去部署,更加需要在超节点上部署,这是他特意强调的。就是因为最后能发现,因为专家数量足够多,那么我每次是调10