研究背景
数据中心能耗巨大且占比持续增长,例如ChatGPT每年耗电约2.06亿干瓦时,预计到2030年美国数据中心电力消耗将达390太瓦时,占全社会用电量7.5%。数据中心任务具有时空灵活性,在线任务可转移,离线任务可推迟执行。CloudOrchestration技术使得多云数据中心能在跨域市场信号引导下协同调度任务,实现资源余缺互济。
关键挑战和创新点
关键挑战:
- 大规模计算任务调度:任务大规模、高并发、复杂依赖,调度问题强随机、非线性、NP-hard。
- 多云隐私安全保护:集中式调度需全局信息,但数据中心间存在商业竞争,需隐私保护。
- 多主体个性化决策:数据驱动方法受主体差异影响,导致决策偏离最优解。
创新点:
提出考虑隐私约束和主体异质特性的联邦强化学习方法,实现跨地域市场信号驱动下多云数据中心的电-算协同优化。
模型方案
将多云数据中心协同调度问题建模为部分可观测马尔可夫决策过程(Dec-POMDP),每个云数据中心运营商(CSP)视为智能体,基于任务信息和跨域电价信号进行任务转移与资源分配。
- 状态:计算任务信息(可转移性、依赖关系拓扑、资源占用)、计算资源特征、电价信息、时间。
- 动作:任务转移决策和本地计算资源分配决策。
- 奖励:完成任务收益、能耗成本、任务转移成本、超出截止时间惩罚。
- 状态转移:确定性映射。
分布式联邦强化学习框架
为解决隐私安全问题,提出基于分布式训练分布式执行(DTDE)框架下的联邦强化学习框架:
- 本地更新与训练:每个CSP独立收集轨迹,利用策略梯度下降法分散更新局部损失函数。
- 局部参数聚合更新:从邻近数据中心收集参数,通过联邦强化学习框架聚合更新。
- 聚合模型参数回传:将聚合模型参数回传给CSP,引导其继续分散执行并更新局部模型直至收敛。
个性化损失函数重构
通过重构局部损失函数,平衡本地异质特征和全局聚合特征间的更新权重,实现异构环境感知的主体个性化决策。证明了基于重构损失函数的算法收敛性。
算例分析
验证了所提方法在跨域电价信号引导下多主体数据中心协同调度的有效性:
- 跨域信号引导的协同任务调度:任务转移至电价低、资源充足的区域,降低运行成本。例如,数据中心2和3在电价较低时将任务转移至数据中心1。
- 考虑隐私约束的协同调度:与集中调度方法、完全分散调度方法相比,所提方法在保证优化效果的同时,提高了收敛速度。比完全分散调度方法总成本降低18.6%,DDL违反率降低30.8%;比集中式调度方法收敛速度提高30.3%。
- 异质主体个性化决策:考虑任务到达模式、调度决策、区域电价等异质信息,实现个性化调度决策,进一步降低运行成本,优化资源配置。
结论与展望
提出感知环境异质性的分布式联邦学习框架的调度方案,实现多主体数据中心在市场信号引导下的协同优化,在满足隐私保护等约束的前提下释放了更大程度的灵活性。未来可拓展到更多算力场景,并进一步探究多主体数据中心间协同优化的商业模式和利益分配机制。