大模型基础设施是推动大模型应用落地的关键要素,但目前普遍面临可用性低、稳定性差等问题。本报告分析了大模型发展对基础设施提出的新需求,并从计算、存储、网络、开发工具链和运维管理五个核心能力领域,剖析了基础设施发展的关键技术。
大模型基础设施面临的挑战:
- 计算资源分配粗放,利用率低: 训练任务排布不合理导致资源碎片化,推理请求波峰波谷现象明显导致算力空闲,算力调度系统存在资源超额申请问题。
- 海量数据处理低效,数据存储成为瓶颈: 海量原始数据归集等待时间长,训练数据预处理时间长,训练阶段检查点文件读写效率低,大模型推理记忆时间短、存在输出幻觉。
- 并行计算规模攀升,网络通信成为阻碍: 大模型训练通信开销大,多机多卡互联性能成为瓶颈,网络规划需综合考虑AI服务器的端口需求和存储需求。
- 模型参数急剧增长,开发效率成为约束: 大模型训练资源需求普遍较大,模型微调、提示工程等增量环节带来开发工具新需求,超大模型的推理服务需大规模计算资源支持,大模型部署需满足推理侧设备多架构要求,推理任务要求实时性高,推理效率仍需提升。
- 基础设施故障率高,运维能力成为挑战: 万卡集群训练任务盲启动,失败频发,训练过程故障频发,大模型基础设施可用度低,涉及的软硬件故障模式繁杂,故障管理挑战巨大。
大模型基础设施关键技术:
- 高效算力管理调度技术: 虚拟化、容器化、池化技术成为算力弹性调度基础,异构并行技术成为算力统一纳管新技术,基于预测模型的算力调度体系成为算力调度新选择。
- 高性能大模型存储技术: KV-cache技术实现长记忆存储,助力大模型推理降本增效,加速卡直通存储实现数据直达,并行文件系统提高数据供给效率,近数据向量知识库提高大模型检索效率,减少输出幻觉,数据编织技术加速跨域数据高效归集,统一数据管理提高全流程效率。
- 高通量大规模网络技术: 高性能互联技术迭代升级,有效提升网络服务稳定性,网络负载均衡技术实现最优化流量转发路径,助力解决“算等网”问题,参数面、存储面/样本面、业务面、带外管理面网络互联,助力大模型高效训练。
- 高效能大模型开发技术: 训练加速技术涌现,有效支撑大规模高效构建,大模型微调技术出现,模型训练效率进一步提升,模型压缩技术持续演进,兼顾压缩比例与性能损耗成为首选,大模型推理引擎持续创新,持续提升大模型推理效率。
- 高容错大模型运维技术: 训前健康检查,保障作业零隐患运行,全栈全路径统一监控分析,资源实时监控,断点续训,提高模型训练效率,智能运维,实现故障可预测、可恢复。
高质量大模型基础设施评价指标:
- 技术能力: 支持大模型训练种类、集群扩展能力、虚拟化能力、存储协议、并行策略、续训能力、芯片互联能力、资源可视化、资源调度、故障隔离等。
- 性能能力: 标称算力、集群稳定性、集群可用度、计算规模、算力利用率、存储容量、存储性能、互联带宽、传输时延、故障定位时间、故障恢复时间、基础设施能源效率等。
高质量大模型基础设施典型实践:
- Meta: 通过任务调度优化、网络路由策略优化、存储系统优化、训练框架优化等,提升大模型基础设施的计算、存储、网络和软件能力。
- 蚂蚁集团: 构建面向绿色计算的大模型基础设施技术体系,通过全局编排调度、智算混部、基于算力经济模型的算力调度体系、KV-cache技术、分布式训练加速技术、DLRover分布式训练容错、无痛升级技术等,支撑蚂蚁百灵大模型训练和推理。
- 某科技公司: 通过异构算力调度的大模型训练平台、AI数据湖存储、全局文件系统、内生向量知识库、智能拓扑感知、动态负载均衡调度的故障感知与自愈方法等,提升大模型训练稳定性,显著提升整体性能表现。
总结与展望:
大模型落地需求推动推理侧大模型基础设施新发展,绿色低碳将进一步成为大模型基础设施发展重点。