发布时间:2026-07-28 一、核心要点 1. 本次为东吴传媒互联网及海外科技张良卫团队的Kimi K3技术报告解读电话会议,属面向机构投资者的非投资建议内容。 2. Kimi K3为全球首个2.8万亿级参数量开源大模型,推理激活参数约1040亿,采用896专家MoE架构(每次推理约激活16个专家),上下文窗口达100万token。 3. Kimi K3核心架构含自研KDA+MLA混合注意力(3:1比例)、跨深度残差连接、带负载均衡的MoE架构,配备原生多模态视觉分支MoonViT V2,预训练上下文从128k扩至1M,K2资源利用率提升2.5倍,技术实现质的飞跃。 4. Kimi K3后训练为三阶段流程:SFT冷启动(人在环标注专业数据)、带反RewardHacking机制的RL强化学习、On Policy Distillation(在线蒸馏) ,关键优化含Partial Rollout抗长尾、推理预算控制等。 5. 评测表现上,K3在Agent长推理类8类任务分数随计算量提升稳步上涨,在Web DevArena等第三方评测超越部分对手,进入第一梯队,部分维度仍有短板;与DeepSeek对比,Kimi K3性能更优,成本高1-2倍,二者通用GPU基建水平接近。 二、风险与关注 1. Kimi K3部分维度仍有短板,工具使用、多角色协作等领域表现待提升,未来专用GPU芯片研发或影响DeepSeek的底层优势。