大模型时代的异构计算平台
GPT-3开启大模型时代
- GPT-3的1750亿参数模型带来了质的飞跃,具备处理各种新任务的通用能力,如数学计算、阅读理解、多轮问答、SAT考试、新词构造、指代推理等。
- 爆款应用如AIGC文生图、ChatGPT拉动大模型训练需求。
- 大模型训练需要足够的数据与算力,模型参数规模持续增长,从ELMo到GPT-3,参数量从90M增长到1750B,计算量达到314 ZFlops。
超大模型训练对基础设施的需求
- 大模型训练面临算力墙和存储墙的挑战,需要分布式加速和存储优化。
- 常见的并行策略包括数据并行、流水线并行、张量并行和分组参数切片。
- 数据并行通过梯度同步实现,但存在加速比和收敛性问题。
- 流水线并行通过调整mini-batch数据执行顺序减少气泡,张量并行将单层操作切分到多卡进行。
- 分组参数切片通过切分参数和优化器状态减少显存冗余。
- 大模型加速策略包括减少计算量,如条件计算和混合专家模式。
- 飞桨4D混合并行训练框架支持流水线并行、模型并行、数据并行和参数分组。
硬件资源需求
- 大模型训练对算力和通信需求高,1750亿参数、3000亿词语、1024卡A100需要34天训练。
- 单机硬件选型需高算力、多卡通信能力,如8x NVIDIA A100 80GB显存,134GB/s机内互联。
- 集群网络设计需兼顾P2P延迟和通信吞吐,如8导轨优化的三层CLOS架构,支持16000卡规模。
软硬件结合的联合优化
- AI加速库如AIAK-OP实现代码自动生成,图接入包括动态图和静态图,社区方案如TorchDynamo。
- 后端加速通过计算执行时间分析和算子融合实现,算子融合包括模型方向和算子模式。
- 算子实现优化包括手写算子、半自动化模板和基于搜索的优化。
- 通信优化包括交换机哈希冲突解决和All2All加速,SHARP技术提升AllReduce性能。
- 端到端自动化任务切分与放置通过构建计算、通信的costmodel搜索优化,性能提升2.1倍。
大模型发展推动基础设施演进
- 大模型演进趋势包括参数规模持续增加、算力需求增长和异构资源多模态训练。
- 集群与业务演进需多组异构集群和RoCE网络,基于统一视图的端到端优化。
- 百度百舸·AI异构计算平台2.0支持城市大脑、工业互联网、产业金融、智算中心、生命科学和自动驾驶等业务场景。