K3总参数2.8万亿,支持100万Token上下文和原生视觉。Frontend Code Arena前端设计能力排名第一;Artificial Analysis智能指数57分,按模型配置排名全球第4,紧随Fable 5和GPT-5.6 Sol的两档高推理配置。 #K3的核心是超稀疏MoE与长任务架构协同。 K3采用896选16的超稀疏专家模型,每个Token从896个专家中选择16个,按路由专家数量计算,激活比例仅1.79%;Stable LatentMoE在扩大专家总容量的同时保持稀疏激活;KDA用可更新状态压缩长上下文,并保留部分完整注意力,缓解KV Cache和带宽压力;注意力残差按内容调用前序层信息,改善深层信息传递;Mooncake分离式推理和预填充缓存进一步复用长任务中的重复前缀,官方称编程负载缓存命中率超过90%。 #长程任务能力是当前兵家必争之地。 kimi官方案例包括48小时无人值守完成芯片设计,以及120多轮递归改进生成ASIC产业交互式研究网站。 #定价是本次最有投资含义的信号。 K3每百万Token输入3美元、输出15美元,与Claude Sonnet 5标准价一致,输出价为GPT-5.6 Sol的一半。我们认为,这是国产模型首次主动进入海外SOTA价值定价区间。 #官方建议K3部署在64张以上加速器组成的超节点。 这反映了896选16超稀疏MoE对专家并行和高带宽互联的要求。稀疏MoE避免每个Token激活全部专家参数,但没有消除2.8万亿参数权重的承载需求和跨卡通信压力。 #K3改变了国产模型在我工作流里的位置,上一个是GLM5.2。 路演时领导应该见过,我的CC Switch长期接着Claude、GPT、GLM和Kimi。过去我主要让国产模型处理简单、重复任务,一方面用于持续实测能力,另一方面用于平衡成本;K3发布后,我愿意把Kimi调入主力模型池,直接承担复杂研究、长时程编码和知识工作。 #国产模型已经进入主力模型池、并继续冲击全球能力前沿。