Moonshot AI 发布了首个开源 2.8T 模型 K3,在多个指标中表现突出,其中在自然语言处理领域排名第三,仅次于 Fable5 和 GPT-5.6 Sol (Max),在前端代码领域排名第一。K3 主要面向长时程编码、知识工作和推理任务,具备 1M 上下文长度和原生多模态能力。该模型在成本效益方面表现出色,其 Delta Attention 架构可实现百万级 token 上下文解码速度提升 6.3 倍,而 Attention Residuals 架构则能在成本增加不到 2% 的情况下将训练效率提高 25%。与 K2 相比,K3 在整体扩展效率上提升了 2.5 倍。
根据 Silicon Data LLM Token Expenditure Index,7 月 12 周指数显示 token 消费持续疲软,但中国模型在成本效益方面表现优异,DeepSeek、Qwen、Kimi、MiniMax 和 Zhipu 等模型相较于美国模型具有显著优势。OpenRouter 数据显示,中国模型的 token 消费量在 7 月 6 周达到 27.6tn,较前一周增长 17.7%,超过美国模型。其中,DeepSeek V4 Flash、Xiaomi MiMo-V2.5 和 MiniMax M3 分别位居前三。
报告认为,AI 模型需求的增长将受益于 Baidu、Alibaba、Tencent 等云服务提供商以及 AI 实验室和 Kling。中国模型在智能水平上正逐步缩小与美国的差距,API 成本也远低于美国模型,这得益于其 MoE 架构、线性注意力机制和 MLU 技术。未来,编码、工作空间场景以及中长篇内容创作领域将迎来重大机遇。