其实CPO语境下的Scale-Up和Scale-Out,是AI数据中心里两种完全不同的算力扩展场景,对应CPO的落地方向也差异很大:
1. CPO对应的Scale-Up场景
它的核心聚焦在机柜内部,目标是尽可能拉高单个基础算力单元的密度和性能,简单说就是在小范围空间里把GPU等算力硬件的互联效率拉到最高 【1】 。
当前传统的铜缆+NVLink方案已经摸到了性能天花板:每通道200Gbit/s速率下传输距离仅2米,后续想继续翻倍带宽的难度极高,CPO落地到这个场景后,就能取代铜缆实现GPU到GPU、节点到交换机的更长距离互联,同时大幅降低功耗,彻底突破现有铜连接的传输距离限制,理论上可以把机柜内的Scale-Up算力单元扩展到非常大的规模 【3】 【8】 【9】 。
2. CPO对应的Scale-Out场景
它的核心是跨机柜的分布式算力扩展,通过新增更多算力节点,把工作负载并行调度分配到不同的资源节点上,以此获得近乎无限的扩展能力,更适合处理大规模并行任务和高并发请求 【1】 【6】 。
CPO落地到这个场景后,就能实现机架之间的远距高带宽连接,同时拥有更低的延迟和功耗,适配AI驱动的云架构以及以太网/InfiniBand网络 【3】 。