罗远:万卡智算集群建设运维分享及演进思考
个人简介
罗远,科大讯飞数据中心首席架构师,负责公司自有数据中心网络设计与架构迭代,推动数据中心从传统组网架构向云计算时代再到智算网络时代的转型。去年负责并落地了全国产万卡智算集群的网络架构设计与实施运行。
大模型基础说明
- 大模型发展:以ChatGPT、GPT-4等为代表的大模型快速发展,推动机器智能实现范式跃迁,开启机器自然语言交互式学习的“类人”新范式。
- 讯飞星火大模型:自2023年5月首次发布以来,星火大模型在多项能力上持续升级,包括通用模型对标GPT-3.5、突破代码能力、多模态交互升级等,全面对标GPT-4 Turbo。
- 认知智能大模型的技术阶跃:大模型的智能涌现让机器真正掌握和运用人类语言和知识,推动机器智能进入全新阶段。
万卡智算集群建设运维分享
- 万卡集群简介:万卡智算集群规模庞大,涉及海量光纤和模块,网络拓扑复杂。
- 集群光链路问题:光连接稳定性是关键挑战,Llama3故障根因分析显示算力平台相关问题复杂多样。
- 集群负载均衡优化:传统流转发算法在智算网络场景中易导致负载不均衡,讯飞万卡集群正从静态路径绑定向算网一体化调度过渡。
- 平台工具与体系建设:构建跨专业域的任务级运维平台,实现故障快速定位和恢复。
- 智算集群项目运维难点:AI训练要求故障快速恢复,备件及时到达,跨产品问题难定位,海量光纤/模块问题难排查。
- 运维解决方案:通过技术/人力补充、维保服务、跨专业域的任务级运维平台、组织流程变革等措施,提升运维能力,保障大模型任务长时稳定运行。
更大规模智算集群的演进思考
- 技术演进:网络拓扑从减少网络直径、盒式交换机向Dragonfly、Torus演进;接入带宽从200G向400G、800G提升;拥塞控制和RDMA传输模式不断优化。
- 更大规模集群中的设备互联:LPO光模块互联方案优势在于低成本、低功耗、低延迟,但系统误码率和传输距离有所折衷。
- 更大规模集群的组网选择:三层Fat Tree、二层全互联结构、CLOS组网方式各有优劣,Dragonfly拓扑在十万卡集群中可节省交换机和互联链路数量。
- 拓扑优化:通过跨POD收敛比优化、超节点引入、OXC按需连接等方式提升网络效率。
- 算网协同:通过网管平台和训练平台联动,动态构建跨POD通道,实现Spine-free组网。
- 更高速率更大规模集群的挑战:更大部署地域需要更合理的方案,高速光模块对机房环境和人员操作提出更高要求。
思考与探讨
大模型和智算集群技术持续演进,未来需在更高速率、更大规模、更优拓扑等方面持续优化,以应对新的挑战。