00:00:00 大家好,欢迎参加申万宏源计算机kimik3发布国产模型能力加速。目前所有参会者均处于静音状态,下面开始播报声明请参会人员务必注意,本次电话会议交流内容仅限参会人员内部参考,任何机构或个人不得以任何形式对电话会议任何内容进行泄露或外发。请勿以任何方式索要、泄露、散布、转发电话会议纪要。任何泄露电话会议纪要等信息的行为均为侵权行为,申万宏源研究保留追究泄露转发者法律责任的权利。 00:00:44 诶好的,那呃线上各位领导大家好,我是万计算机的陈清华。然后线上还有呃同事洪一珍老师,那我这边先开始给大家讲一下这个今天整个的分享内容,然后最后也由洪一珍老师来进行一个总结。嗯,那昨天晚上的话Kimi也是发布了他最新的呃模型K3啊,然后也热度也今天也是非常的高啊,所以我们这边针对呃他这次整体的发布情况,以及包括一些测评来做一个呃分享。 00:01:14 那首先从官方的呃官方的文档还有包括一些呃数值上的比较来讲啊,就是首先PB它确实是把呃开源模型推演推推至了这个,就是呃全球的一个前沿的情况啊,包括也是全球首个开源的3万亿级别的一个模型啊。 00:01:35 那对比来看的话,其实之前国内的模型基本呃还是在1T以内的呃一个情况啊,最多之前就是像。智呃那个Kimi是发布了这个呃一期的一个版本,然后像质谱是744billion量,然后其他陆续的也有几百billion量参数的一些这个模型,那第一次呃做到三呃3万亿级别这么规模的啊,就是呃这个Kimi的K3。那从整个能力上面来看,它在长城编程还有知识工作和动作态理解方面都做到了呃,同一模型去端到端完成的一个情况。那根据这个artificial analysis analysis的这个榜单来看,呃它的综合智能能力还有包括像coding的能力,还有包括Agent能力都能够去达到媲美全球前沿的一个呃情况,也就仅次于这个F5和呃GPT5.6的一个水平啊。 00:02:31 是呃能够跟这个像OPPO4.8之类达到呃类似的一个水准,呃那这里面呢其实更核心的它还是在架构上做了三层的一个优。 00:02:44 化能够使得它去达到这种大参数量下的一个效率提升, 00:02:48 那首先还是K呃月战暗面自己之前去提出的一个KDA的混合新型注意力。嗯,那这个也是算月战面它原创的一个呃架构啊。就是在里面通过3:1的一个显呃混合线性注意力,然后就3呃3的这个混合线性注意力,然后一的这个呃全局注意力去做,使得整个的呃PVcache的缓存它能够最高降低45%,从而实现更高效的一个长上下文的解码。那第二个也是偏向于它原创的这个呃attention residues这个部分,那过去传统的模型当中的这个残差的处理更多是固定的一个残差累加。 00:03:27 呃,那月之面它的Kimi呢,就采用了一个以输出呃为呃为这个呃考量的一个动态的跨层路由啊,所以能够使得这个生成网络去选择性地复用早期的一些表示啊从而。去提高它整体的一个效率,那从他自己的官方提供的呃比较来看,就是能够在小于2%的一个额外成本下,去提供差不多25%的一个更高的呃训练效率。 00:03:57 那第三个是针对这个Mo OE专家层的一个呃提升,就是latent MoE啊。那核心思路是呃过去其实对于路由来讲,就是我把这个计算直接表示直接路由到这个各个专家里面去,那他在这之前做了一层,就是把呃这个表示去呃压缩到一个低维的一个空间,相当于进行了一个压缩。那再去给到这个呃路由专家,使得整个的呃训练层的效率能够去提高啊。 00:04:27 这个思路也可以说类似于像去年呃DeepSeek去提的那个mla核心思路,也是把这个呃token去进一步的压缩啊,只不过那个呃m a当时是在整个注意力层去做,那呃Kimi的这个它核心还是。在针对这个把呃表示的这个过程,给到专家的这个步骤里面去做了进一步的呃压缩啊。 00:04:52 所以通过呃这三层的一个架构升级,整体能够实现就是1.7%的一个诗疏度啊,就总共896个专家16个激活,然后整体的一个效率也能够去提升2.5倍。 00:05:07 呃那这次发布呢,就非常呃重要的一个变化就是价格进行了非常大幅的一个提升啊。 00:05:15 就我们如果来对比现在海外和国内的主流模型去看的话, 00:05:19 呃Kimi K3的一个价格可以说是呃,定位到了媲美海外顶尖币源的这么一个价格的一个情况啊。 00:05:27 就是呃如果来看的话,Kimi K3现在已经是呃基本等于这个谷歌军带3的一个这个呃价格水平,然后高于group呃group4.5,然后呃也就仅次于这个像GPT5.6和Fi5这些旗舰模型,可以说定价是非常高的。那放到国内的模型里面来看的话,它的定价就是呃更高,完全就是高出一个这个档位的一个情况啊,就是之前国内模型里面可能价格最高的就是,呃,这个。呃,阿里的这个呃千万3.7,还有质朴的GLM5.2,嗯,那Kimi的价格可以说基本上是他们的嗯,两两倍多的这么一个两到呃2~3倍甚至4倍多的这么一个情况,所以整个定价是非常高的一个呃状态。 00:06:17 呃,那我们其实觉得呃一方面来讲的话,就我们会看这个单独的API I定价,然后第二个其实现在考量的更多的是这个单位成功任务成本,也就是说我在完成一个任务里面,它呃到底花费的是多少成本。那参考这个呃A A的这个一个计算来看啊,就是它对比的是呃整个的cost tax,就是一个任务里面的成本,然后还有它的整个智能的一个index去看的话,那Kimi的K3现在在智能能力上差不多是媲美嗯, 00:06:51 Cloud4OPPO4.8的一个呃类似程度啊。但是单任务成本相比海外的顶尖。模型要下降很多啊,但是同时呢,呃对于国内其他模型来讲,它的成本单任务的一个成本就会高出呃非常多, 这是第一个。那第二个就是更多还是参考这个可持续任务时长的一个能力。 00:07:14 那Kimi他自己给到的几个案例里面来讲,首先他呃这次Kimi的K3是参与了自己的一些内核优化,就是它呃在测评的时候,也是去根据24小时内测试了这个呃模型优化GPU内核的一个能力。那整体的呃测评上来讲是和呃飞过五相当的一个情况啊那也提到了, 00:07:36 就是早期的这个K3的版本,也是承担了大部分后期K3版本里面呃内核优化的一个工作。那第二个包括像自主芯片和科研工作任务里面来看,它也分别完成了像48小时自主运行的一个呃任务,以及约等于这个研究人员需要1~2周去完成的这个工作啊,仅在两小时。小时内就去完成,所以看到现在K3整个在呃,长任务的一个长时间任务的一个处理能力上也是有非常大的一个提升。 00:08:07 呃,那以上是官方公布的一些情况,那呃我们也是做了一些案例上的测试啊,那给也给大家分享一下。 00:08:16 第一个首先是一个自动化任务的呃这个呃测试,就是让这个智能呃让这个模型去自动地呃爬取这个数据,然后做清洗,然后去生成excel和PPT。也就是可能对于我们来讲呃尤其是这个二级的研究人员来讲,日常会去需要的一个长城的任务啊。那它核心会需要这个Agent自己去调用一些浏览器的工作,然后模拟真人操作这个网站,然后去呃download的这个数据,然后把它进行excel输出,再根据excel去呃生成这个图片和PPT。 00:08:51 啊,那整体来讲,测评下来觉得Kimi的Agent在完成整个任务过程中速度还是会。呃比较慢啊,就相比较下来,同样的任务可能只要M5.2是10分钟,然后DeepSeek V4是呃12分钟,但是Kimi的K3需要15分钟去呃去完成,所以从时长上来讲,它呃略微的更长一点。 00:09:14 呃,那从优点上来讲的话,就是它的自呃问题发现和修改能力还是非常不错的,就过程中 有报错的情况下,也不需要去呃人工介入,可以去自主地完成整个的排障闭环啊。 00:09:27 那包括在整个工作流过程中,它也是采用了呃子智能体去并行完成任务的一个模式,也就是把这个任务分分拆完之后,各个子智能呃各个子任务是并行去完成的呃一个情况。 00:09:41 那第二个就是呃采用了API,那上面那个任务是用客户端去做的,那我们也尝试了一下API啊,那API给到他的是比较简单的一些这个开放性的任务啊,比如说去写一些这个文案的一些对比那。因为任务很简单,所以大家生成的质量和速度都呃差不太多。但是整体过程中会发现,像DeepSeek它消耗的这个token好像会多于呃,这个G要M5.2和这个呃Kimi的K3啊。但整体其实大家大差不差。但是在处理比如说更常输出的一些, 00:10:17 会发现Kimi K3的API I现在整体稳定性还比较差啊,就是呃在生成第二个第三个任务的时候,K3是没有去完成的。就是呃它这个整体就是请求了,就是整体这个多次请求里面就挂了这个5~7分钟超时的一个情况,然后整体的这个时延和成本都比较失控,所以现在我们整体觉得它的API I可能因为刚上的原因,还不是呃特别的稳定。那通过这个客户端和这个呃Agent的端,其实相对来说任务稳定性还是不错的。 00:10:51 呃,那第4个其实有一个案例就是呃,我想也想给大家直接地做一个展示啊就是。 00:10:59 是我们也是让这个呃模型自己去做了一个网页游戏的搭建,那首先是K3搭建的这个游戏,就是这个游戏的核心,是能够让我用键盘和鼠标去控制游戏中的这个人物,然后去收集6个能量水晶,然后呃最终的呃获胜。 00:11:16 那首先是K3的这个版本,能够看到它整个的游戏画面都还可以, 00:11:22 但是其实呃在操。哎。嗯,但是其实在操作的过程中会发现,呃操作的一个体感上面还有这个鼠标的一个移动体感上面,呃还是略有一些,还是还是略有一些这个别扭的一些情况 啊啊, 00:11:41 但是整体来说完成度还是不错的。嗯,那第2个是这个飞过5的一个情况。呃飞过5的一个情况,总体来说就是虽然画面上可以说是跟K3基本上呃大差不差,就是包括开头的一个这个呃呃介绍啊,但是它的实际上的一些呃操作感受,哎我的电脑有点卡。呃实际上的一些操作感受啊,还有这个移动还有这个呃鼠标移动的控制啊等等,它整体的感感觉会更加的呃顺滑和丝滑一些啊, 00:12:23 整个的对比就是这样。所以呃从这个呃整个的一个效果上来看啊,就是我们觉得他们的完成度其实是呃差不多的,包括画面的一个审美啊构建啊也是呃差不太多,但是可能在一些操控的一些这个感受上面呃还是会有一些差差距。就是实际操作的这个体感较我F5还是会有一个差距。 00:12:48 呃,那还有一个就是呃也是这个呃一个测评案例啊,就是让呃fable还有GPT5.6和Kimi的K3分别去搭建一个就是金字塔,随时间推移的一个建造效果啊,那首先,三家的完成度都还是不错的,但是可以看到会略有一个风格上的差异。嗯,那整体来。来讲就是可能fivo5在整个动态的生成就是效果上,比如说我在移动这个就是呃控制盘的时候,它的动态的一个效果会做得更好一点啊,那Kimi的K3右上角这张图,它的呃动态生成建造的一个过程啊会更好一点。但是GPT5.6的话,它在整个的一个细节展现上会会更好一点啊。 00:13:35 所以其实从这两个案例里面来看,嗯K3在整个的生产能力上面,包括任务的完成度来讲,跟海外的呃顶尖地源模型差距不是特别大。但是值得注意的是它的稳定性还是会呃略弱一些啊。就是呃同样完成一个任务,可能呃顶尖的一些模型,它一次这个呃完成就已经是达到这个要求的,就达到这个用户要求的这么一个成功率了,但是可能K3它在部分的生成过程中可以有很好的效果,但是在其他的一些次数里面。它生成的效果没有这么好啊,所以在稳定性上面我们觉得还是会呃略有这个差距啊。 00:14:17 所以最后总结来讲,整体评价上面呃首先会分为网页端、客户端和API直连的几种方式 啊。 00:14:26 就是呃在网页端和客户端,我们觉得K3是展现出与呃,官方和这个大家网上一些测评展示的比较一致的一个