登录
注册
个人信息
我的订单
我的报告豆
我的优惠券
我的笔记
我的阅读
我的收藏
我的下载
我的上传
我的订阅
在线客服
退出登录
回到首页
AI
搜索
发现报告
发现数据
发现专题
专题报告
专题百科
研选报告
定制报告
VIP
权益
付费社群
发现一下
行业研究
公司研究
宏观策略
财报
招股书
会议纪要
Token
低空经济
十五五
AIGC
大模型
当前位置:首页
/
行业研究
/
报告详情
大语建模布式训练时的量化分分析与最佳实践 , 以 GPT - 175B 为例
文化传媒
2023-08-08
DataFunSummit2023:大模型与AIGC峰会
高杨
大型训练模型的挑战与解决方案
大型训练模型的挑战
高计算成本
每次迭代的计算成本公式为 \( h(1 + 6h^{16B}) \),其中 \( h \) 为隐藏大小,\( B \) 为批量大小,\( V \) 为词汇大小。
GPT-3 175B 模型训练需约 2150 ZettaFLOP(1 ZettaFLOP = 1024 ExaFLOP),使用 128 个 DGX A100 服务器需 170 天,计算效率约 50%。
高内存成本
模型状态总内存约 3.5 TB,其中参数 350GB,梯度 350GB,优化器 2800GB。
单个 GPU 无法容纳模型,需跨节点并行。
大型变压器训练技术概述
并行技术
:管道并行、张量并行、序列并行、专家并行。
内存优化
:分布式优化器(类似 DeepSpeed ZeRO-1)、检查点激活、选择性激活检查点。
其他技术
:FP16/BF16 训练、优化内核、通信重叠。
GPT-3 模型的分布式训练
模型并行性
张量模型并行
:层内拆分,实现简单,适合大矩阵,但通信频繁。
管道模型并行
:层间拆分,通信粗粒度,可推广至所有 DNN,但需大批量数据。
张量并行示例
MLP 层:前向全归约,反向 all-reduce。
自注意力层:前向 all-gather,反向 reduce-scatter。
序列并行
Megatron v3 新增,前向 reduce-scatter,反向 all-gather。
交错管线模型并行
结合张量并行和管道并行,优化通信开销。
存储要求与优化
激活内存优化
完整检查点
:存储输入激活,需额外前向计算,内存减少但计算开销约 36%。
选择性检查点
:仅重计算部分激活,开销降至 4%。
分布式优化器
Megatron v3 新增,分区优化器状态,不牺牲性能。
存储分析
模型内存
:每个设备约 1.37TB(175B 模型)。
模型状态
:AMP 优化后内存成本显著降低。
激活内存
:完整检查点需前向重计算,选择性检查点结合序列并行效果更佳。
数据并行化与通信成本
数据并行性
:\( T1 = Mg_{BW} \ imes 2(d-1)/d \),其中 \( BW \) 为总线带宽,\( d \) 为数据并行规模。
张量并行通信成本
:与并行规模和通信模式相关。
管道并行通信
:采用散射-聚集机制。
计算分析
GPT-3 175B 训练
:每个 GPU 模型 FLOPS > 150,训练效率需 > 120 Model TFLOPS/A100。
建议
内存不足时
:采用选择性激活检查点、分布式优化器,逐步引入张量并行(序列并行+1024/2048 GPU),再逐步管道并行,最后使用完整激活检查点。
内存充足时
:增大 batch size,采用数据并行。
混合精度建议
:BF16 适用于 > 20B 模型。
你可能感兴趣
开源量化评论(117):分域多策略研究:以偏股基金指数为例
开源证券
2026-01-26
基于‘结构-工具-效力’框架的集体产业用地更新政策量化分析:以广州为例
苏州科技大学&自然资源部国土空间规划研究中心&广州市城市规划勘测设计研究院有限公司
2025-09-12
基本面量化专题(一):以焦炭为例:基本面量化择时之单指标筛选
东证期货
2019-09-18
促进气候恢复力和碳中和的拟议生命周期方法:以塔吉克斯坦公路分项为例
公用事业
亚开行
2024-09-01
2024新能源货车在城市和区域运输场景中的技术与经济可行性分析:以中国广东省为例
交通运输
世界资源研究所
2024-12-08
绿色技能开发的区域与国别经验比较分析:以欧盟、德国、美国和新加坡为例
公用事业
国际劳工组织
2025-09-22
大消费行业智慧CRM最佳实践:构建以客户为中心的数智化营销平台
玄武云
2023-03-15
开源量化评论:扎堆效应的识别:以股东户数变动为例
开源证券
2022-11-22
以苏州市、镇江市城投公司为例:一城多“投”,寻找企业对比的量化指标
民生证券
2017-09-13
沪铝持仓与交易量放量因素分析:成交与持仓行为研究(以铝为例)
招商期货
2014-06-12