KimiK3因用户请求量逼近现有集群极限而暂停C端新用户订阅,并明确采用超节点推理方案进行算力扩容。其核心模型为2.8万亿参数的MoE模型,部署时将896个专家均匀分散在多张卡HBM中,单次推理激活16个专家,采用WideEP宽域专家并行方案,推理时产生海量All-to-All通信,重度依赖卡间高速Scaleup通信;同时,模型支持100万Token超长上下文,KVCache需求大,依赖超节点实现内存池化。K3官方白皮书建议使用≥64卡超节点部署,表明超节点已成为推动国产算力发展的关键方案,标志着国产算力迎来“NVL72时刻”。