项目背景与建设方案
政策背景与行业需求
国家政策大力支持算力网络建设,特别是《东数西算工程》和《算力基础设施高质量发展行动计划》等文件,引导算力资源向西部倾斜,促进东西部协同发展。贵州作为国家枢纽节点,出台系列激励政策,包括算力中心建设支持、数据流通奖励等。人工智能行业需求激增,智算中心市场预计2028年达1825亿,CAGR≈56%。贵州智造业等数字化转型需求强烈,需构建“弹性可扩展、算力多元化、绿色高效”的区域级算力枢纽。
核心业务场景需求
项目需满足渲染集群(46PFLOPS算力,3年内算力翻倍需求)、AI训练(PB级数据,超1万亿参数模型)、协议传输(AllReduce协议,<0.14秒传输效率)等核心需求,同时兼顾成本可控、高可靠性(年非计划停机≤4小时)等目标。
智算中心定义与架构
智算中心是以GPU、AI加速卡为核心,提供软硬件全栈环境的新型算力基础设施,主要承载模型训练、推理、多媒体渲染等业务。典型架构包含通用计算、智能计算、高性能计算子系统,以及高速网络、存储系统和安全系统。智算与通算区别在于新增参数面和数据面网络,采用RoCE全连接无损组网。
业务架构设计
项目聚焦大模型推理、离线渲染、生成式AI开发、边缘计算协同四大核心业务,部署144台8卡GPU服务器(总算力1152卡,40TFLOPS/卡),采用“计算-网络-管理-安全”协同架构。网络能力基于大二层架构与Spine-Leaf拓扑,实现端到端延迟≤50μs;可靠性通过全链路冗余设计(网络、供电、散热)达成系统年非计划停机≤4小时目标。
设备参数与技术实现
GPU服务器采用超微S83-4090T8(8张NVIDIA4090 GPU),FP32算力达40TFLOPS/卡;核心交换机为华三S9850-4C(400G QSFP-DD×4),形成全Mesh冗余连接。网络创新采用大二层Spine-Leaf架构结合RDMA技术,RoCEv2协议将GPU间通信延迟降至≤20μs,模型训练周期缩短53%。硬件选型兼顾高算力、高可靠、低成本,如超微服务器性价比优于戴尔30%,华三网络设备成本比思科低40%。
存储与安全方案
采用“分布式存储+分层存储”架构,高性能层使用NVMeSSD,容量层采用HDD硬盘结合纠删码技术;备份与容灾通过自动快照备份实现同城灾备。安全方面,防火墙双机热备架构串联边界过滤,实现10Gbps安全防护。
二期规划与政策适配
二期计划新增FCSAN与IPSAN混合架构存储,通过Core交换机10G端口互联。项目适配贵州算力券和万企融合补贴政策,申报流程包括前期准备(1-2个月)、正式申报(3-4月),重点突出技术融合、绿色指标、产业链带动等优势。
方案价值与结论
项目实现算力统一门户,将超算与智算能力结合,提供超700PFLOPS算力,高速网络采用800Gbps带宽,高性能文件存储超过9PB。方案有效提升科研水平,助力双一流建设,同时满足海量数据分析、等保合规等需求,为人工智能产业发展提供有力支撑。