东数西算算网协同调度业务场景白皮书总结
一、“东数西算”概述
- 背景:数字经济发展推动数据量爆发式增长,东部算力供给受限,西部资源丰富但需求不足,“东数西算”工程应运而生,旨在促进东西部算力协同联动。
- 目标:规划建设国家级算力枢纽节点和数据中心集群,实现算力的规模化、集约化发展,提升使用效率,降低使用成本,推动资源高效配置。
- 意义:带动相关产业发展,促进产业结构优化升级,实现东西部资源优势互补,缩小数字经济发展差距,提升整体数字经济竞争力。
- 发展历程:2021年政策奠基,2022年启动建设8个国家级算力枢纽节点和10个数据中心集群,2023年底发布《关于深入实施“东数西算”工程加快构建全国一体化算力网的实施意见》,明确“算网协同”发展方向。
二、整体架构
- 系统架构:异地、异构、异属的算力资源通过网关并网,构建“全域可达、动态可控、高效可用”的算力资源池,为算网协同调度平台提供标准化服务支撑。
- 平台功能:包含资源需方入口、资源供方入口、协同调度模块、任务调度模块、流量调度模块和数据调度模块,满足算力消费者在算力、网络、存储等多维度的使用需求。
三、调度架构
- 总分调度架构:全局调度为“总”,区域调度为“分”,用户通过统一平台实现对所有算网资源的无差别调度使用。
- 分总调度架构:算力资源具有自治能力,通过自治系统业务入口实现算网资源调度使用,同时支持自治系统内部调度和与算网协同调度平台的协同调度。
- 混合调度架构:资源提供方可根据情况选择自治系统内部调度、自治系统与算网协同调度平台协同处理或直接向算网协同调度平台请求调度,增强资源调配自主性,达成资源高效协同,确保业务稳定运行,实现成本效益最优。
四、应用场景
- 东数西算场景:将东部数据传输到西部进行计算和存储,优化应用部署,保障数据迁移,采用差异化数据集处理策略。
- 数据快递场景:借助确定性广域网实现海量数据高速、安全传输,满足智算大模型训练、超算科学计算与工程仿真等前沿领域需求。
- 东数西存场景:将东部数据归档存储到西部,优化存储配置,支持异构存储适配,提供高效数据传输服务,实现全生命周期管理。
- 协同训练场景:实现多个智算中心共同协作完成训练任务,支持千亿参数量模型训练,兼容多元主体,实现异构GPU混训和并行训练优化。
- 协同推理场景:整合全网边缘云上的GPU资源,提升并发能力,支持模型独立演进,优化冷启动,实现镜像和模型预热。
- 西训东推场景:将训练任务调度到西部,推理任务分发到东部,解耦优化效能,实现训练资源优化和推理就近访问,高效管理模型文件。
五、生态模式
- 边云一体模式:本地私有云/一体机与算网协同调度平台结合,满足企业多元化资源获取需求,突破本地资源瓶颈。
- 云算分离模式:云供应商通过算网协同调度平台满足用户复杂需求,拓宽业务边界,提升客户满意度。
- 边缘共享模式:企业共享闲置算力资源,创造额外收入,提高资源投资回报率,促进行业资源优化配置。
六、商业价值与前景展望
- 商业价值:提升资源利用率和灵活性,降低运营成本,推动相关产业链发展,形成规模庞大的数字经济产业集群。
- 前景展望:技术创新将提升调度效率和数据传输性能,跨区域、跨行业合作将更加紧密,企业应积极拥抱变化,提升数字化竞争力。