- 核心观点:月之暗面开源的新一代基座模型Kimi K2具有显著潜力,在编程和逻辑方向的多项基准测试中达到SOTA能力,接近Claude 4 Opus水平,同时具备优秀的推理成本控制,适合用于Agent开发。
- 关键数据:
- 参数规模:1万亿参数,单次激活参数320亿,上下文长度128k。
- 基准测试表现:SWE-bench Verified/LiveCodeBench/AIME 2025/GPQA-diamond等测试集成绩达到Claude 4 Opus相同水平。
- 成本优势:API输入(命中)/输入(未命中)/输出定价分别为1/4/16元每百万Tokens,较Claude 4 sonnet有约80%的成本优势。
- 技术创新:
- 数据合成:通过智能体数据合成提升工具使用能力和Agent能力,构建工具模拟器环境进行“练习”。
- 优化器:MuonClip优化器提升训练稳定性,降低计算资源消耗。
- 模型架构与优化:
- 基础架构:继承DeepSeek-V3模型架构,将专家数从256提升至384,降低MLA头数以优化成本控制。
- 未来展望:若开源智能体数据合成的工程方案,将进一步提升基座模型逻辑能力;加入思维链能力后训练的模型值得期待。