核心观点: 随着AI大模型的兴起,传统数据中心网络架构面临性能、功耗、扩展性等挑战,而光电混合组网架构能够有效应对这些挑战。本文提出了基于拓扑模板和全局策略的集中式控制架构FIRE,通过离线集中式计算和在线分布式控制,实现快速路由收敛和灵活的网络路由控制,提升AI集群网络的性价比。
关键数据: 华为云直播业务“95计费”方案下,接入流量调度问题导致流量成本占比高达60%,本文提出的调度系统通过优化流量分配策略,能够将流量成本降低80%以上。华为云AI大模型训练的流量成本估算显示,通过所提算法节省数亿元人民币的成本。
研究结论: 跨AZ分布式AI训练需要考虑带宽收敛、距离长、计算资源不对称等问题,本文提出了基于语义相似度的模型布放方法、层次化集合通信算法、传输协议优化等技术,以减少跨集群通信的损失,提升算效。未来,基于LLM的无线网络运维Agents系统通过将大语言模型的语义理解能力和运维专用小模型相结合,能够有效提升网络运维能力,为无线网络交互式运维提供新的解决方案。