大模型的发展历程经历了从标准数据中心网络到超大数据中心网络,再到如今由AI大模型驱动的智算中心网络阶段。大模型参数规模从千亿增长到万亿,并从单模态发展到多模态交互。AI大模型算力对网络提出更高需求,万卡训练能显著缩短训练时间。
当前AI大模型网络实现主要涉及待训练数据传输、Checkpoint数据传输,以及GPU服务器间通过PCIe网卡和GPUdirectRDMA进行数据同步。GPU服务器内部则通过GPU芯片直出进行计算结果同步。
未来网络演进趋势显示,推理应用和领域模型应用将超越大模型训练的规模。大模型正从训练走向部署和落地,模型推理市场兴起,领域模型类型愈加丰富。头部芯片厂商英伟达2024财年40%数据中心收入来自推理业务,网信办备案的领域大模型占大模型总备案数的69%,国内推理服务器占比预计从2023年的41.3%增长到2027年的72.6%。推理场景对算力成本和运营成本的要求远超训练大模型,决定模型训练结果能否落地部署。
观止大模型强化认知能力,提供3B~70B多种模型大小,适用于不同应用场景,曾获NDSS2024杰出论文奖,并在开源模型思维链能力榜单中排名第一。
推理和领域模型对网络提出异构算力按需分配和数据高效互通的需求。网络演进方案包括网络融合支持算力并池灵活调度,以及高性能协议支持数据高效传输。未来智算网络方案需提供网络空间支持数据在各类算力间高效流转,支持商用RoCEv2、自研RDMA协议及TCP/TCP-X接入,并兼容多种商用和自研物理网卡,实现解耦/虚拟网络解耦。