我整理了不同代际主流AI服务器GPU对应的光模块适配配比,都是当前行业普遍认可的通用标准,不同集群规模、组网架构下会有小幅浮动哦:
一、英伟达各代际GPU常规适配配比
- H100系列
标准DGX-H100 SuperPod集群采用ConnectX-7双端口InfiniBand网卡,单颗GPU对应1个400G光模块+1.5~2.5个800G光模块 【3】 ;在Hopper时代通用三层Scale-out网络架构下,行业通用基准配比为1颗GPU对应约3个800G光模块 【1】 。
- Blackwell系列(B200/GB200/GB300)
- DGX-B200 SuperPod、早期GB200 NVL72搭配ConnectX-7网卡时,和H100配置基本一致,单颗GPU对应1个400G光模块+1.5~2.5个800G光模块 【3】 。
- GB200 NVL72升级ConnectX-8网卡后,单颗GPU对应1个800G光模块+1.5~2.5个1.6T光模块;如果是576GPU规模的2层NVLink Switch组网场景,单颗GPU的1.6T光模块配比可达9:1 【3】 。
- GB300的标准SuperPOD万卡级集群场景下,仅计算网络的光模块与GPU比例为2.5:1,叠加存储网络后总配比接近4:1,其中GPU:800G光模块:1.6T光模块的比例为1:1:2.5 【5】 【6】 。
- 普通GB300基础场景下1.6T光模块和GPU的配比为1:2
3,升级到英伟达VR200机架后,1.6T光模块的配比直接翻倍到1:46 【2】 。
- Rubin系列
传统可插拔光模块方案下,2层组网的Rubin集群1.6T光模块与GPU配比为1:4,3层组网场景下配比提升至1:6;如果采用CPO共封装互联方案,光模块用量会大幅下降,1.6T光模块配比从1:4降低到1:1 【4】 。行业通用的Rubin时代三层Scale-out网络基准配比为1颗GPU对应4~4.5个1.6T光模块 【1】 。
二、其他厂商自研芯片的适配配比
- 谷歌TPU V7:ICI互联层+数据中心网络层合计,单颗TPU对应2个光模块,其中ICI层占1.5个、DCN层占0.5个 【7】 。
- 海外CSP自研ASIC:谷歌、亚马逊的ASIC光模块连接率普遍为1:4,Meta自研ASIC搭配复杂DSF解耦调度网络设计,800G光模块配比可达1:8~1:12 【2】 。
- 国内主流自研GPU/ASIC:采用每服务器8卡标准设计的国产芯片,800G光模块的通用配比为1:4~6;华为云矩阵384采用全光连接架构,光模块配比高达1:18 【2】 。