国产超节点研报总结
一、基础定义与核心价值
- 超节点定义:整机柜级一体化高密度算力单元,将32张及以上国产NPU/GPU/DCU加速卡通过自研高速互联、统一全局内存、原生液冷、集群调度软件深度耦合,逻辑合并为“巨型超级计算芯片”。
- 核心解决三大算力瓶颈:
- 通信墙:自研互联总线带宽达TB/s级别(PCIe的10~50倍),跨卡时延百纳秒级,MoE大模型All-to-All通信损耗下降60%+,集群算力利用率提升至70%以上。
- 内存墙:全局统一显存编址,多卡显存池化为共享内存,解决大模型长序列KVCache内存不足问题。
- 功耗墙:单机柜功耗50~120kW,原生集成冷板式液冷,支撑单卡2kW以上高功耗AI芯片稳定运行。
- 核心战略意义:在单芯片制程受限背景下,通过系统级弯道超车,综合算力与训练效率可对标甚至超越英伟达NVL集群,是国内智算中心自主替代核心方案。
二、国产超节点五大核心底层技术栈
- 自研芯片直连互联总线:
- 华为HC(昇腾互联总线):昇腾910C/950DT全对等Mesh互联,单机柜384卡,集群最大8192卡,全光互联总带宽16.3PB/s。
- 海光+曙光HSL互联总线+scaleFabric:支持DCU多卡无阻塞直连。
- 通用互联芯粒(奇异摩尔):KiwiG2GIOD芯粒,基于UCIe标准,兼容所有国产XPU,单芯粒互联带宽2TBbps。
- 无线缆/正交高密度物理架构:
- 曙光scaleX系列正交对插无线缆架构:硬件部署简化80%,单向通信时延<100ns;scaleX640单机柜640卡,全球商用最高算力密度;scaleX40面向中小企业。
- Chiplet芯粒异构集成:
- 计算芯粒:昇腾、海光、沐曦、清微可重构RPU。
- 互联芯粒:奇异摩尔KiwiIOD、昇腾Nimbus互联芯粒。
- 存储芯粒:东方算芯DF1000近存计算。
- 封测:长电XDFOI、通富微电2.5D/3D混合键合。
- 整机柜一体化热管理:
- 冷板式液冷标配:高密度训练机型浸没/冷板式全液冷(64~640卡),轻量化推理机型间接液冷;散热效率提升3倍,PUE降至1.1以下。
- 统一算力调度软件栈:
- 华为CANN+CloudMatrix全局内存管理。
- 曙光ParaOS分布式算力操作系统。
- 沐曦、清微自研编译器适配MoE、万亿参数大模型。
- 核心能力:跨卡显存透明访问、自动负载均衡、故障卡在线隔离。
三、头部厂商主流国产超节点产品矩阵
- 华为Atlas950SuperPoD:
- 算力核心:昇腾950DTNPU(FP8单卡算力2EFLOPS)。
- 规模:单机柜384卡起步,集群最大8192颗NPU。
- 互联:全光HC对等Mesh互联。
- 定位:万亿参数大模型训练、国家级超算中心、头部互联网万卡集群。
- 中科曙光scaleX640/scaleX40:
- scaleX640:单机柜640卡,总算力630PFLOPS,可双柜组合1280卡。
- scaleX40:40卡轻量化机型,成本对标5台8卡服务器,推理性能提升330%。
- 配套芯片:海光DCU全栈适配。
- 沐曦曦景S系列:
- 算力核心:曦云C600通用GPU。
- 架构:3DMesh多卡直连MTLink互联,128卡标准单元。
- 适配:开源大模型深度适配(LongCat等万亿MoE模型)。
- 浪潮/新华三/阿里云:
- 浪潮元脑SD200:64路国产GPU互联,面向政企智算中心。
- 新华三UniPoDS80000:柜内互联带宽提升8倍,推理效率+80%。
- 阿里云磐久AL128:128卡液冷超节点,公有云推理主力机型。
- 特色差异化路线:
- 清微智能可重构超节点:基于清华大学RPU可重构数据流芯片,硬件逻辑随AI任务动态重构,晶体管利用率70%+,4096颗芯片Mesh直连,互联成本降低90%。
四、完整国产超节点产业链上游
- 算力芯片:昇腾、海光、沐曦、清微、东方算芯。
- 互联核心:奇异摩尔互联芯粒、盛科通信25.6T/51.2T国产交换芯片。
- 配套硬件:液冷设备、高速光模块、整机柜供电。
- 先进封测:长电科技、通富微电Chiplet/2.5D封装。
- 集成厂商:华为、中科曙光、浪潮信息、新华三、沐曦、阿里云、中兴通讯。
五、行业发展现状与趋势(2026年)
- 放量元年:2026年市场规模突破百亿,三年复合增速194%,国资算力采购强制国产替代驱动需求爆发。
- 技术标准化落地:工信部《》国标2026年正式实施,ODCC推出超节点统一技术白皮书,解决多厂商生态兼容问题。
- 两大技术路线并行:
- 极致性能路线:华为全光大规模超节点,对标海外顶级训练集群。
- 普惠高密度路线:曙光无线缆、轻量化40卡/64卡机型,下沉中小企业市场。
- 芯粒互联成为通用底座:奇异摩尔标准化G2G互联芯粒普及,打破单一厂商私有互联壁垒,异构国产芯片混合超节点集群成为主流。
- 算力竞争从芯片转向系统:行业共识,单卡性能不再是唯一指标,互联、散热、调度软件、整机集成共同决定集群有效算力,国产超节点体现系统层面优势。
六、对比海外方案核心优劣势
- 优势:
- 自主可控全栈国产供应链,无海外芯片、互联协议出口限制。
- 轻量化机型性价比突出,中小推理场景综合成本降低40%~50%。
- 适配国内东数西算、政务、工业等本土化场景深度优化。
- 无线缆、一体化运维设计,降低机房部署与运维门槛。
- 现存短板:
- 单卡FP8/FP4极致算力仍弱于英伟达高端GB系列。
- 万卡级超大规模集群工程落地案例少于海外。
- 部分高端800G光模块、SerDesIP仍存在进口依赖。