网络架构演进与未来趋势
数据中心网络域定义与作用
- 数据中心网络域主要分为 Scale-out 和 Scale-up 两种,两者平行且不重叠。
- 网络的主要作用是增强芯片协同与数据传输,包括 GPU 间、CPU 间、GPU 与 CPU、GPU 与存储、存储与存储的协同。
- 现代数据中心网络是云计算架构的核心,支持算力资源的虚拟化和高速调度。
Scale-out 网络
- 定义:泛用型数据网络,承载各类数据包,如 GPU 协同、CPU 协同、存储通信、南北向流量等。
- 特点:标准化程度高,AI 数据中心普遍采用无收敛的三层或两层设计。
- 未来趋势:以太网协议拓展,如融合以太网协议的分布式或切片式处理,以减少跳转次数,提升传输效率。
Scale-up 网络(超节点)
- 定义:算力卡协同网络,实现高性能计算集群内部的高速通信。
- 演进:
- 早期:单服务器内部 NVSwitch 芯片实现小规模 Skype 网络。
- 中期:单柜超节点(Rack-scale),如英伟达 72 卡机柜或谷歌 64 卡机柜,通过 Switch Tray 和 NVSwitch 实现更大范围连接。
- 现状:跨柜超节点,如谷歌 Ironwood Super Pod(144 个 64 卡机柜,9216 张卡)和英伟达 Rubin Ultra 576(576 张卡),通过柜间光通信实现更大规模集群。
- 未来趋势:持续扩大网络规模,增加交换芯片和光引擎数量,实现光进同退。
主流架构案例分析
- 英伟达:Rubin Ultra 576 采用超节点设计,柜间通过光引擎实现互联,下一代将采用 Kaiber 机柜和 1152 张卡超级点。
- 谷歌:
- Ironwood Super Pod:采用 3D Tourris 环状网络架构,144 个 64 卡机柜通过光模块和 OCS 交换机连接,形成 9216 张卡超节点。
- Boardfly 架构:针对推理卡,采用多层级 Dragonfly 设计,形成 32 个 Group 的 1024 张卡超节点,显著减少跳转次数。
- 国内厂商:华为、阿里、腾讯等采用类似设计,单层超节点交换机统筹机柜,通过 NPU 光引擎实现连接,未来将向更大规模超级点发展。
未来趋势总结
- Scale-up 网络:持续扩大规模,增加交换芯片和光引擎数量,实现光进同退。
- Scale-out 网络:以太网协议拓展,分布式或切片式处理,提升传输效率。
- Scale-cross 网络:未来几年将大规模普及,连接多个数据中心,带来相应投资机会。