00:00:00 大家好,欢迎参加国泰海通计算机kimik3解密2.8万亿参数之后,国产大模型下一城。目前所有参会者均处于静音状态,下面开始播报声明,本次电话会议仅服务于国泰海通证券正式签约客户,会议音频及文字记录的内容仅供国泰海通证券客户内部学习使用,不得外发,并且必须经国泰海通证券研究所审核后方可留存。 00:00:26 国泰海通证券未授权任何媒体转发此次电话会议相关内容。未经允许和授权转载转发均属侵权,国泰海通证券将保留追究其法律责任的权利。国泰海通证券不承担因转载转发引起的任何损失及责任。市场有风险,投资需谨慎。提醒广大投资者谨慎做出投资决策。 00:00:50 各位线上的机构投资者,各位领导,大家晚上好啊,非常感谢大家抽空嗯参加我们今天昨天嗯布置的一场。 00:00:58 对,然后那今天呢,嗯或者说昨天啊,这将飞呢是正式发布了它新一代的旗舰款工作模型千之3。那这是全国的首个面向开源社区开放的,呃3万级3万亿级别的参数的大模型的,那总的参数量是达到了2.8万亿,然后上下文窗口呢是在百万token。然后整体呢,这个完整的权重会在7月27号之前开源啊,那它的核心架构上是有很多创新的啊,包括MoE架构,它是在接近900个专家里面啊,高效地去激活16个,相较于它之前的上一代的模型整体扩展效率是提升了差不多2.5倍。 00:01:38 然后它的定价呢,呃毕竟3万亿参数它定价确实有所提升,那相较于飞波5的话,它的整体定价水平是在C5模型的1/3这样一个水位啊。具体就是输入价格二十二十,然后输出价格100人民币每百万token。那他系现在性能表现呢,呃,也是非常夸张啊,让整个社区都感到非常振奋啊。它的综合智能水平是位列全球第三的啊呃,在一些细分赛道呢,是 对这个cloud C5还有GPT5.6实现了反超的啊。 00:02:14 所以说现在全球产业链呢也迎来了一个关比较关键的节点吧,就海外现在正在演绎这个token通缩,或者说模型智能水平,双T2模型能力的商业化价值通缩的这样一个逻辑啊。那今天我们也是非常荣幸邀请到产业界非常资深的专家向总啊,给我们解读包括K3的底层的一些技术路径啊,还有它的成本结构啊,包括它的这个定价策略啊。 00:02:38 以及这个开源模型对全球大模型迭代和商业化的一些冲击。 00:02:42 那首先呃,向总感谢您的这个参与啊。嗯,请您从这个K3的架构创新还有工程实现这个方向去展开介绍一下。嗯,好的,嗯,这个模型它。嗯,它它其实主要是在这个, 00:03:02 首先是网络架构上。王教生。过去的是这个,这个这个就是啊,这个主要是这种长城任务会偏少。啊,那么这也是这次这个K3模型啊, 00:03:15 最为重点强调的一点,就是说在这种啊。长程的复杂任务上,并且也特意提示了,就是说呃,如果说你用这种智能体框架啊去接不同的模型的时候啊,那么它这个模型可能会失效,就是它比较依赖于。这个历史的上下文信息啊就是。没有这个的话,他的长征任务可能做的也一般般啊。这个主要是他在后训练阶段。 00:03:39 啊是用了这样的一种方法啊,就是长城任务是它的一个呃亮点,然后体现在呃这个技术里面啊,那么对应于这种层层的任务啊,首先就是啊我就要去做一些这种更深度的这种信息的连接,就过往我可能。呃,我我我比如说我模型20万上下文,然后我一个任务可能需要耗费50万上下文啊,那么我可能每个每个每一个小的这个模块儿。每个小的这个子的这个模块里面,可能它就有20万上下文, 00:04:12 那么这个时候。过去它的像K206等等这些模型啊,就是你在20万三位下,它是能够去 呃,记得这个第一个token跟最后一个token之间的这种深层次的关系。那当你现在在长城任务任务里面,你的上文扩展到100万的时候。啊,我怎么让这个100万摄文它真正的发挥它最大的效果啊, 00:04:34 我要做一个更深层次的连接,就是我确保我第一个token出来的时候,以及跟我最后。呃,这个token出来的时候,他俩之间还是依旧能够有一个很强的这种绑定能力,也就是说这种深度信息的这种能力,这个能力它其实是。 00:04:51 呃,通过早期这个何凯宁提出了一个技术,就这个叫呃,当时叫rest的这个网络啊,它叫残差网络。他把传达网这个思想。用在了这个attention这个这个注意力机制上啊,从而保证说Kimi K3这个这个模型啊,这么多的专家。然后这么大的一个模型,然后在。 00:05:13 这种很长的任务上啊,他依旧能够记得这个啊,能够比较比较清晰地记得说,就不会出现说这个做新的任务忘记前面的任务啊,所以这个这个我觉得是一个呃这次他。面对这种任务的特色,做了一个比较新的一个点啊,当然它下游任务呢,这个时候可能就不局限于说只有代码了啊,我们看到他在这个。办公场景这些word。以及PPT场景下啊,效果也不错。 00:05:43 啊这这这这是一个比较核心的一个点,呃,那么还有一些点就是。 00:05:48 在这个MoE架构上啊就做了一些东西,就m e架构,嗯,是一个从24年大家一直在琢磨琢磨到现在啊,那么目前Kimi这台MoE它的这个专家网络。这个专家数量啊,也是全球这个专家数量做到最多的,其实呃,这也是我一直以来一个观点,就是这我在24年应该就。嗯,当时也是这么认为,就是说。怎么当时是32个64个啊,会往后一直拓展啊,就当时在目前的技术平颈上,当时我说的是大概能拓展到1024个左右啊。目前看啊, 00:06:21 经过一年多不到两年的时间啊,Kimi把这个no OE这个专家数量往前拓展到接近1000个了,也就说这种非常稀疏的这种专家。啊,它其实里面拓展核心是你要训练出一个。就是 这个被你调度的专家越多,那你中间这个类似于交换机一样,这个东西这个这个调度啊路由器啊,你怎么去。呃,这种负载均衡式的,你去思考去用哪些专家去解决具体的问题啊。所以这种呃,这这个这个这个对于这种吸收专家这方面的这个这个这个这个探索啊,这个听IM力也往前。嗯,走了一步, 00:06:59 然后还有一点就是在这个。嗯,这个这个算是模型。呃,模型这个这个量化与训练上啊。这个过往的话,他会偏向于。啊,我先用16比特这个这个东西去训练,我后面再去事后再去压缩。啊,那么呃,Kimi这次呢这个K3这个模型它是呃我在SFD阶段啊,我就用这个MXFP4这个权重和这个MXLP8这个权重啊,互相去混合去训练。啊这样的话,呃,它能确保说对国产来讲,我一个2.8个亿参数的模型啊,我也能在一个有限的相当于是相对国外来说相对有限的算力下。 00:07:44 啊实现这样的一个训练,而且在推理端,呃,我这个能够比当然当然比国内模型目前要贵一点啊,比国外模型啊大概能够便宜一个可能是它的一个1/3左右。啊,就是这这这是一个。就是说从这个呃这个单价从成本端啊他去考量的一件事情。所以我觉得这几点是比较核心的,它在呃这个这个模型的这种一些单点的一些创新吧。对,大概大概是这样。好的,感谢向总啊。 00:08:23 然后就是关于刚刚咱们提到那个问题,它这个开源呃,跟这个中美大模型front这模型的差距已经基本上就是缩在6个月以内嘛,大家就担心它。这种顶尖的闭源模型和开源模型的差距会被进一步拉近到两三个月,那这个对于闭源模型的商业化来说就是比较危险了。那之前大家给顶尖模型的商业化价值带来的高溢价啊,呃给的这个估值,这个这个趋势可能就不太撑得住啊,那就引发这种呃frontier模型的token通缩啊,您对这个是怎么看?嗯,这点是这样,就是嗯这个国内肯定是目前啊,在这个在开三发布期间,国内这个前沿模型离国外啊,大概是一个呃半年到9月这样的一个差距的情况下。啊,然后我们想在啊。 00:09:19 呃,占领全球这样的一个心智,那么其实我们你如果说不开源,你是无法啊无法走到这一 步的,所以说对于我们来讲,嗯,这也是国内这几家为什么都通通都往这条路走了,就是你必须得或者说叫你。在能力不够的情况下啊,你不得不去开源,然后啊让全球全球去在你这个模型上去啊。 00:09:44 添砖加瓦啊,包括说呃开源的话也是能够。这个将用户先用这种免费的这种这种形式啊,先让他进入到这个我这个模型的生态圈子里来,因为他用户用的时候他会发现。嗯,这个模型可能跟Kimi自己的这个Kimi code啊结合起来会要更好一点,包括Kimi也推出那个,后面会推出这个。啊,它跟企业版类似于企业版的这种Kimi code的就是说横跨企业信息流的。就是虽然我模型是开源的啊,但是呃,你想达到好的效果。啊,你光靠一个模型你是不行的,所以说开源模型能。 00:10:23 嗯,等于说前期以这种呃,比较呃,比比较这种低的这种成本的形式啊,去我我去将这些。啊C端的包括B端用户啊先吸纳过来啊,然后我再就同样一款模型。然后你不同的啊,你你你这些企业你这些用户啊,他可能不太可能去自己部署啊,因为他自己呃去呃去部的情况下,第一个就是说C端肯定是不太可能的啊,因为这这次这个模型对于这个算力还是有一定的要求的啊。 00:10:54 然后B端呢,呃对于这种新的算力形态,嗯官方也建议了嘛,是这个,呃,接近超节点的这样的一种算力形态。啊,跟之前这个早期DeepSeek这个提供的思路是一样的,在这种形态下,其实很多企业啊,你未必能玩得转。就是同样,你就算买了这样一套硬件啊,你去部署你可能也达不到一个。 00:11:17 呃,这样好的一个效果啊,所以我认为,呃, 00:11:20开源是当下。这个促进大模型更快地从这个有这么好的一个效果的, 00:11:27去往这个应用端去呃渗透的过程,相反我觉得呃它其实。在这个通往AGI之前。 00:11:36 啊,其实我我觉得各个企业啊这种方式,尤其国内这些企业啊,其实还挺好的, 00:11:41 其实我觉得啊能够加强它这个。啊这个真正的这个这这这个这个AR这些数据啊,因为你你其实靠靠C端这些订阅啊,它这个它这个东西啊,它它其实很难有一个。就是说在这个在在在目前国内这样一个付费。付费的这样一个情况下啊,它这个AR很难去提升得比较快,但是B端这个付费意愿各方面啊,包括它的业务场景啊,它其实这块它提升会比较快,就参考国外的这个呃啊,所以呃Kimi这次是呃对外是发布了这些东西,但是它同时也在。这个积极地去做这个面向B端的这样的一个啊A的框架,所以我觉得啊这块才是一个。 00:12:28 比较核心的趋势去提升这个。这个这这个这个企业工作端的这些,嗯。这些价格啊,他他应该应该是我觉得这样会啊, 00:12:39 更适合我们目前啊模型相比国外落后的这样一种情况,因为其实国外模型啊,它啊并不是说是到这个像cloud.F这样的一个水平啊,就是它它其实下个阶段模型也会马上出来。拿出来就是,嗯,并不是说这次这个K3发布出来之后我们就。呃,就就就就这个离国外可能无限的接近,其实目前。综合能力上还是有一些距离。 00:13:05 啊,大概是这样。理解啊,那向总他其实海外对于这个通缩,大家呃不是说认为这个中美的这个差距会在短期缩减到呃,基本上就开源模型完全可用,就顶尖边缘模型它的溢价呃趋近于零。 00:13:23 不是说这样的呃而是大家会提前演绎一个预期,就是在呃模型能力撞墙。就至少从目前coding这个场景啊,它如果到达一个非常高度可用的一个呃专家级水平的情况下,啊呃然后以s so比,它率先呃到了一个模型撞墙或者说迭代速度收敛的这样一个境界。那在那个时候,如果说中美或者说必然和开源模型的差距在两到三个月时间,那相当于呃开源生态。再等两到三个月就能呃实现对这种front天元模型的一个追赶啊,所以说闭源模型的 商业价值可能就会被。 00:14:02 呃,虹吸虹吸的非常严重啊,就是您对这个趋势怎么看?嗯,我觉得他肯定会受一定的影响,就是说如果说从呃国内国外之间去。呃去去对比的,对比的话啊就是会呃现在国外也有这样的一种趋势啊,就这些。啊像像像像这个code X等等这些模型和这这些AI框架