KimiK3发布:近3T参数开启Scaling新阶段,实现模型规模与Scaling效率双重突破。
核心观点与关键数据:
- KimiK3是全球首个达到2.8T参数规模的开源模型,并具备原生视觉理解能力。
- 架构层面采用KDA与AttnRes技术:
- KDA通过混合线性注意力兼顾长序列处理效率。
- AttnRes提升深层网络的信息传递能力。
- StableLatentMoE将专家数量扩展至896个,实际单token仅激活16个,激活比例约1.8%,在扩大模型容量的同时控制计算开销。
- 训练方法与数据配方优化使K3相比K2的整体扩展效率提升约2.5倍。
研究结论:
- KimiK3在模型规模和扩展效率上实现显著突破,为开源大模型发展提供新标杆。
- Coding、Agent与知识工作能力全面提升,展现更强的应用潜力。