英伟达HGX H100(即DGX H100服务器所采用的平台)的电源方案可以从以下几个维度来看:
DGX H100服务器的整体机架功率约为10.2kW,这不仅仅是GPU的功耗,还包括了CPU、内存、NVSwitch、NVLink、网卡等所有组件的总功耗 【1】 。
在电源模块配置上,该服务器采用了6个3.3kW的电源模块,总电源功率约为19.8kW 【1】 。这里有个有意思的点——为什么总电源功率比整机实际功耗高出这么多?这其实是冗余设计的考量。即使部分电源模块出现故障,系统仍能正常运行,保证了高可用性 【1】 。
从负载比例来看,DGX H100的电源负载比例约为52%,这个数字其实挺讲究的——电源在50%-60%负载比例下转换效率最高,英伟达显然在能效方面做了精细的权衡 【1】 。
具体到功耗分配,每台DGX H100服务器正常运行时的预期平均功率(EAP)约为10,200W,每台服务器8个GPU,每个GPU的功率为1,275W。这个数字包含了H100本身的700W热设计功耗(TDP),以及分摊到每个GPU上的双Intel Xeon Platinum 8480C处理器约575W功耗,再加上2TB DDR5内存、NVSwitches、NVLink、NIC、重定时器、网络收发器等组件的电力需求 【3】 。
简单算一下,服务器总功耗与GPU功耗的比例大约是10200/(700×8)≈1.82倍,行业里一般保守按1.5倍来估算服务器功耗与GPU功耗的关系 【3】 。
从英伟达服务器电源方案的演进脉络来看,早期的DGX A100额定功率为6×3kW,而DGX H100/H200则升级为6×3.3kW 【4】 。这种功率提升的背后,反映的是芯片迭代带来的功耗上升——H100的TDP已经达到700瓦 【5】 。
到了基于GB200芯片的NVL72架构,机架功耗更是直接跃升到了120kW的水平,电源需求为6组33kW的PowerShelf,总电源功率约198kW 【1】 【4】 。可以看到,AI服务器电源正朝着高效率、高功率密度的方向快速发展 【4】 。
这里想多说一句,DGX H100的电源方案其实体现了几个关键设计思路:
冗余优先:6个电源模块的设计,即使坏掉一两个,系统依然能稳定运行,这对大规模AI训练集群的可靠性至关重要 【1】 。
能效优化:52%的负载比例不是巧合,而是刻意让电源工作在最高效区间,降低能源浪费和散热压力 【1】 。
功率密度提升:随着AI服务器功耗持续攀升,数据中心在能耗与成本管控方面的要求愈发严苛,这正强力驱动着AI服务器电源向高效率、高功率密度的方向迈进 【4】 。
总结一下:HGX H100的电源方案可以概括为——6×3.3kW电源模块、总功率19.8kW、约52%负载比例、整机功耗10.2kW,通过冗余设计保障高可用性,同时将电源效率控制在最优区间。这套方案也为后续更高功耗的GB200 NVL72等架构奠定了设计范式。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803