DeepSeek发布DS-V3.1模型,采用混合推理架构和UE8M0 FP8 Scale参数精度,显著提升思考效率和推理能力。核心亮点在于UE8M0 FP8精度的应用,该格式专为国产芯片设计,能有效提升国产芯片使用效率,缩小与NV芯片的效率/成本差距。
FP8精度详解:
- E4M3:1位符号+4位指数+3位尾数,动态范围小,精度高。
- E5M2:1位符号+5位指数+2位尾数,动态范围大,精度差。
- UE8M0:8位指数,无符号和尾数,表示2^n倍数,用于缩放因子,提高稳定性和生态兼容性。
UE8M0来源:
- 源自NVIDIA PTX指令集,用于MXFP8缩放因子。
- DeepSeek通过DeepGEMM开源库实现FP8稳定训练,推动生态落地。
对国产算力芯片的影响:
- 国产芯片需支持E4M3/E5M2算子及UE8M0缩放标准。
- 老芯片可通过FP8存储+BF16/FP16计算节省显存/带宽。
- 新芯片原生支持FP8可提升约2x的算力/显存/带宽效率。
研究结论:
- 低精度训练(FP8)可提高吞吐量,降低内存与带宽消耗。
- UE8M0 FP8平衡动态范围和精度,提升国产卡FP8使用效率。
建议关注:寒武纪、芯原股份、昇腾链、中兴通讯、海光信息等国产算力标的。