GPU利用率是衡量算力资源实际产出效率的关键指标,受集群规模、任务类型(训练/推理)、调度能力等多重因素影响。例如,万卡级超大规模训练中,网络延迟、通信效率和容错机制会直接影响GPU的有效工作时长[6][15]。
阿里云灵骏GPU集群
阿里云在2025年4月披露,其“万卡级超大规模训练中,一个月内灵骏GPU集群有效训练时长占比能超过93%”[7]。这一高利用率得益于两点:
海外云厂商的规模化部署
AWS、Microsoft Azure等已部署数万卡规模的NVIDIA H200基础设施,通过资源池化与动态调度提升利用率。例如,针对推理需求的突发性,云厂商会通过虚拟化技术(如GPU超卖)提高单卡实际使用率,但目前训练场景仍以整卡独占为主[7][9]。
大型数据中心的GPU利用率已实现较高水平(如阿里云超93%),头部云厂商通过硬件优化、调度算法和规模化部署持续提升效率。未来随着推理需求占比上升和虚拟化技术成熟,GPU利用率有望进一步突破[7][15]。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803