华为昇腾384超节点测试验收白皮书总结
引言与背景
随着数字化创新深入推进,各行业向大数据、人工智能转型,数据中心面临承载大规模模型训练和PB级海量数据挑战。华为提出昇腾384超节点架构,通过硬件整合和互联技术解决传统集群效率瓶颈,专为AI算力基础设施设计。
架构创新概述
昇腾384超节点基于Atlas 900 A3 SuperPoD,通过灵衢总线与全光互联实现NPU对等互联,提供超节点内部全连接拓扑和跨超节点400Gbps/NPU RoCE异构互联。架构创新包括:
- 硬件构成:8U机框,支持19英寸机柜安装,正交盲插架构,集成CPU抽屉、NPU抽屉、灵衢总线板、IO框等。
- 互联创新:超节点内部全连接拓扑,跨超节点高速互联,实现NPU对等互联。
- 计算与主机耦合:配套鲲鹏920系列CPU和DDR5-5200内存,提升D2H/H2D路径I/O吞吐能力。
测试体系与方法
测试体系涵盖芯片基础性能、通算、智算、网络与存储等多维度指标,验证高并发、高带宽通信下的性能表现与扩展能力。测试目标包括:
- 通信瓶颈缓解:通过高带宽与低时延通信降低分布式训练中通信占比。
- 显存与算力资源池化:统一编址与对等互联支持更大模型或更高并发的并行策略。
- 运维与可扩展性:模块化机架与标准化接口降低维护成本,全光互联提升扩展能力。
测试方法包括:
- 芯片基础性能测试:8台Atlas 900 A3 SuperPoD上Qwen3-30B-A3B模型训练测试。
- 多机模型训练测试:Qwen3-235B、Qwen3-Coder-480B、DeepSeek等模型评估推理吞吐与延迟。
- 单机与多机模型推理测试:Qwen3-235B、Qwen3-Coder-480B、DeepSeekV3.1-684B等模型测试推理性能。
- 文生图推理测试:Qwen-Image模型验证生成质量与工程化稳定性。
测试结果与优化
测试结果表明:
- 多机模型训练:8机规模下训练过程稳定,跨节点通信无明显瓶颈,扩展效率良好。
- 单机和多机模型推理:DeepSeek 671B模型单卡吞吐性能较优化前提升2.5~4.3倍,单卡吞吐达2122Tokens/s,较业界最佳性能提升9.2%。
- 文生图推理:系统展现优异的图像生成效率与输出质量,稳定响应不同复杂度文本提示词。
核心技术优化包括带宽/时延、可靠性与能效、计算性能等指标优化,通过算子融合替换、PD分离调度、KV cache优化等多维度策略提升性能。
应用场景与价值
昇腾384超节点适用于数字政府、互联网、运营商、金融等行业的大模型训练业务场景,提供高性能、高可靠、易部署的智算能力。具体应用场景包括:
- 多机模型训练:支持更大参数规模、更高计算复杂度的模型训练。
- 单机、多机模型推理:提供稳定、可扩展的算力支撑,提升推理效率。
- 文生图推理:支持智能创作、广告生成、教育培训等多模态应用。
核心价值体现在:
- 系统层面:显著提升大模型训练与推理效率,支撑更大参数规模模型。
- 工程层面:降低分布式训练复杂度,实现超节点内与超节点间高效协同。
- 业务层面:推动模型、框架与应用协同发展,加速AI能力向行业场景规模化部署。
结论与展望
384超节点通过系统级架构设计提升运行稳定性与可维护性,为长时间运行的大模型训练任务和持续在线的推理服务提供可靠保障。未来可在混合精度训练策略优化、分层存储体系设计、与上游数据平台和模型工具链协同等方面开展更深入的工程化测试,持续提升成本效率、系统稳定性与工程易用性。
本次测试验证了384超节点规模化商用的成熟度,为面向大模型时代的智算基础设施提供了可验证的技术路径,体现了体系化测试、调优与交付的可行性,为后续大规模智算平台建设与应用落地提供了经验参考。