[Sun]模型介绍:全球最大的开源模型,略输Fable 5和GPT-5.6 Kimi K3是一个2.8万亿参数模型,基于KDA混合线性注意力机制(Kimi DeltaAttention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,并拥有100万token上下文窗口。它是全球首个开源的3万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景而设计。虽然Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol。 [Sun]技术细节:自研架构重点优化了长程、高难任务 Kimi K3基于Kimi Delta Attention(KDA)和Attention Residuals(AttnRes)构建。KDA为注意力扩展提供了高效基础,AttnRes则不是简单地在各层均匀累积表示,而是有选择地跨深度检索表示。二者共同构成了Kimi K3的架构骨架,使模型能够扩展到万亿参数以上的规模。 Kimi K3采用Stable LatentMoE,在896个专家中实际激活16个。在这样的稀疏度下,路由和优化成为关键挑战。Quantile Balancing直接根据路由分数的分位数分配专家,避免启发式更新和敏感的平衡超参数;Per-Head Muon则将Muon扩展到按注意力头独立优化,让大规模训练中的学习过程更自适应。Sigmoid Tanh Unit(SiTU)和Gated MLA分别增强激活控制和注意力选择性。这些改进共同支持了2.8万亿参数规模下稳定、高效的训练。 [Sun]国产模型高端化的拐点,国模商业化天花板进一步提高 K3的输出价格达到100元/百万Tokens,相比第二名GLM5.2提升超200%。Kimi K3擅长结合软件工程与视觉推理的任务,它能够利用截图和视觉反馈,优化游戏开发、前端和CAD等场景。 免责声明:基于公开资料整理,可能存在信息滞后或更新不及时,任何情况下不构成投资建议 联系人:国联民生计算机吕伟/白青瑞