根据提供的文本,英伟达不同GPU的单位算力成本(以FP8精度为例)可通过算力需求与硬件投资成本计算得出,具体如下:
1. B200 vs H100(FP8精度下的单位算力成本对比)
- 算力需求:以某场景为例,完成1.55×10²⁸ FLOPs的任务,需 18.12万片B200 或 45.30万片H100[2]。
- 硬件成本:
- B200单价约3.5万美元/片,总投资 63亿美元(18.12万片 × 3.5万美元)[2];
- H100单价约2.8万美元/片,总投资 127亿美元(45.30万片 × 2.8万美元)[2]。
- 单位算力成本:
- B200:63亿美元 / 1.55×10²⁸ FLOPs ≈ 4.06×10⁻¹⁸ 美元/FLOP;
- H100:127亿美元 / 1.55×10²⁸ FLOPs ≈ 8.19×10⁻¹⁸ 美元/FLOP。
结论:B200单位算力成本约为H100的 50%,性价比显著更高[2]。
2. H100在FP16精度下的单位算力成本
- 算力需求:若采用FP16精度,完成相同任务需 90.61万片H100(算力需求翻倍)[2]。
- 硬件成本:总投资 254亿美元(90.61万片 × 2.8万美元)[2]。
- 单位算力成本:254亿美元 / 1.55×10²⁸ FLOPs ≈ 1.64×10⁻¹⁷ 美元/FLOP,是FP8精度下的 2倍,凸显高精度计算的成本劣势[2]。
3. 其他参考:GB200超级芯片的算力与成本
- DGX Station搭载的GB300超级芯片,AI算力达 20,000 TFLOPS,但未直接提及单位算力成本[1]。不过结合Blackwell架构的能效优化(如B200较H100成本降低50%),推测新一代超级芯片的单位算力成本可能进一步下降[1][2]。
总结
英伟达GPU的单位算力成本呈现 “新一代架构显著优于前代” 和 “低精度计算性价比更高” 的特点:
- B200(Blackwell) 较 H100(Hopper) 单位算力成本降低约50%[2];
- FP8精度 较 FP16精度 成本降低50%,是当前大模型训练的主流选择[2]。
未来随着Rubin架构等迭代,单位算力成本或持续优化,但需关注HBM显存、先进封装等硬件成本对价格的影响[1][8]。