时代背景与GW级AIDC演进
AI算力需求呈指数级增长,模型参数与训练算力在过去6年增长超过5个数量级,推动数据中心规模从MW走向GW。智算中心(AIDC)经历三阶段演进:Phase 1(服务器即计算机,2012–2022,kW级机柜,千卡集群),Phase 2(整机柜即计算机,2012–2022,MW级机柜,万–十万卡集群),Phase 3(智算中心即计算机,2026–2030,GW级园区,百万卡集群),最终形成GW级AI Factory。
GW级AIDC核心挑战
GW级AIDC面临“五道墙”挑战:算力墙(单芯片FLOPs增速放缓)、能耗墙(单机柜≥1MW,需800V HVDC)、散热墙(单芯片TDP突破3000W,需两相液冷)、互连墙(万亿参数大模型需Scale-Up开放协议)、内存墙(NVLink纵向扩展瓶颈)。破局之道在于系统设计协同。
OCP开放系统蓝图
OCP推出《Open Systems for AI v1.0》蓝图,涵盖应用软件、DC IT基础设施、DC物理基础设施、系统管理层,推动全栈开放协作。关键规范包括ESUN、SUE-T、UALink、ORW、MGX、Catalina、Mt Diablo等。
技术革命
- 供电革命:800V HVDC成为兆瓦级机柜标配,NVIDIA Kyber/Vera Rubin Ultra(2027起)将采用800V DC。驱动力包括NVIDIA Kyber机架需求、Meta等呼吁开放标准、GaN/SiC技术成熟、BBU取代UPS。算电协同是关键,需规划、建设、运营、金融协同。
- 散热革命:风冷极限已至,液冷渗透率2026年将从30%跃升至70%。关键技术包括Gen1冷板式液冷、Gen2单相浸没、Gen3两相浸没/泵驱两相,两相液冷PUE趋近1.04。
- 网络革命:从Scale-Out转向Scale-Up,NVLink/PCIe/UALink/ESUN/SUE-T等协议竞争。Scale-Up范围包括POD间(Ultra Ethernet/ Spectrum-X)和机柜内(PCIe/NVLink/UALink/ESUN+SUE-T),关键应用分别为跨地域负载平衡和万亿参数大模型一致性内存视图。
全球GW级AIDC实践
NVIDIA路线图:Blackwell→Rubin→Kyber→Feynman,Vera Rubin DSX参考架构落地。主要玩家包括Microsoft(2GW扩张)、Meta(Prometheus集群)、AMD(Helios)、OpenAI、xAI、Oracle等,地缘政治变量影响海外建设。
中国GW级AIDC路径
中国智能算力规模占全球29%,CAGR 2023–2028预计46.2%。政策驱动“东数西算”+“双碳”+OCP中国社区。浪潮信息实践包括元脑智算算力仓、SD200超节点、算电协同、800V HVDC与原生液冷预研。商业模式创新包括算力REITs(润泽科技已落地)。
演进趋势与展望
- 开放化:OCP生态推动算力普惠。
- 专用化:训练向低电价发电站集中,推理向城市边缘下沉。
- 全栈协同:芯片-机柜-设施一体化设计。
- Agent-First Datacenter:Agent自主调度算力,Token计费,秒级释放。
2030展望:分布式算力中心与GW级AIDC互补,“算力跟着能源走”,AI支出占IT支出41%,全球投资热潮。
关键数据
- AI模型参数与训练算力增长5个数量级。
- NVIDIA 2027年订单指引$1万亿。
- 中国算力CAGR(23–28)占全球29%。
- 2026年液冷渗透率70%。
- 元脑SD200单机承载4万亿参数单体模型,Token 7.3 ms。
- 沙特PIF追加$50亿投资中国西部智算。