规模化分布式推理架构设计 目录 RCRTech要点3 引言 5 从超大规模扩展到多维扩展——人工智能基础设施的六大未来时代 协调计算是未来人工智能基础设施的九大约束之一。 协调整合成果——CoreWeave对构建分布式AI平台的见解 将人工智能网格从愿景变为现实 13 人工智能基础设施统一理论15 致谢 17 RCRTech要点 推理将AI基础设施问题从集中转变为协调。超大规模AI工厂仍然至关重要,但推理引入了可变延迟、成本、主权、质量和本地性要求,这些要求并不能总能在单一中心位置得到满足。基础设施问题正从计算域可以有多大,转变为特定工作负载应在何处执行。 多维尺度缩放使网络成为AI系统的一部分。AI流量将变得更加机器驱动、对称,并对确定性性能更敏感,而工作负载放置将动态变化。网络需要可编程性、实时遥测、闭环自动化和新的服务级别结构。战略转变是从一个仅传输AI流量的网络,转变为一个直接参与决定分布式AI资源如何被消耗的网络。 编排正成为下一个关键约束。分布式推理比传统应用调度需要更高的智能性。平台必须理解模型状态、加速器可用性、KV缓存位置、延迟、成本、能耗、弹性和治理要求,然后相应地调度工作负载。没有静态的优化公式。组织应优先考虑一个通用的操作层,该层能够在异构模型、加速器和部署环境中应用特定于工作负载的策略,同时保持可移植性和治理能力。 应优化基础设施以实现有用成果,而非最大范围覆盖。对于受延迟、主权或数据本地性约束的工作负载,边缘部署是合适的;集中式算力可能对受益于批处理和高加速器利用率的大规模推理模型仍具有优势。平台应抽象非差异化的运维复杂度,同时暴露对模型质量和经济效益有实质性影响的控制项。相关的关键绩效指标最终将超越每秒令牌数或每美元令牌数,转向每美元有用工作量。 英伟达的AI Grid理念将超大规模AI工厂与区域、电信和边缘基础设施连接起来,以便应用程序可以根据工作负载需求来消耗计算资源。AT&T、思科和英伟达提供了一个早期蓝图,该蓝图结合了分布式加速计算、可编程连接、本地化流量处理、安全性和编排,以支持物理AI应用。对于网络运营商而言,当分布式基础设施作为AI平台的可编程组件被暴露出来时,它就具有了战略价值。 统一的人工智能基础架构需要跨层信令以及组织采取行动的准备状态。应用程序、编排平台、计算基础设施和网络必须最终持续交换意图和遥测数据。工作负载应根据性能、能耗、主权、成本和弹性进行移动,同时基础设施应自动适应。利益相关者应立即通过全面监控整个技术栈、保持可移植性和治理能力,并定义工作负载级别的成功指标来做好准备。电信运营商还必须加速产品周期和商业模式;仅凭地理位置本身无法创造人工智能业务。 下一代人工智能基础设施的定义,将更多地取决于计算能力如何跨多个地点进行智能协调,而非单处能集中多少计算能力。人工智能工厂解决了规模问题。新兴的人工智能基础架构必须通过根据性能、经济性、政策及预期结果,将每项工作任务匹配到合适的设施,从而解决部署问题。 引言 人工智能基础设施建设的第一个阶段以集中化为主要特征。资本、计算和网络资源围绕着日益庞大的AI工厂进行组织,这些工厂旨在训练前沿模型,并在数千个加速器上支持紧密耦合的工作负载。这一投资周期远未完成,但重心正开始转移。随着人工智能从模型开发转向广泛应用,基础设施必须支持规模更大、更多样化的推理工作负载。 以及物理AI,可能需要计算资源以便更靠近用户、机器或数据源。与此同时,那些能从批量处理中获益的大型推理模型和工作负载将继续青睐集中式算力。这些变量表明,推理不应被视为一个笼统的类别。目标是在每个工作负载最能有效产出所需结果的地方运行它。 可用性与管理政策。平台必须吸收运营复杂性,但不能模糊决定性能和成本的控制机制。 新兴的AI时代网络架构将不仅仅被定义为更快的网络或更分布式的云。它是一种连接基础设施、软件和应用意图的运行架构,允许根据工作负载的需求来部署和调整计算、数据和连接。 这引入了一个更复杂的基础设施问题。工作负载放置必须考虑延迟、数据主权、安全性、带宽效率、电源可用性以及移动数据的成本,以及加速器的可用性和特性。由此产生的挑战与其说是构建另一个大型集群,不如说是协调许多不同的领域。连接性必须变得可编程,并能响应应用程序的需求。编排必须理解模型状态、硬件 推理(Inference)带来了不同的架构问题。训练通常是根据持续吞吐量来规划、控制和优化的。而推理需求是由外部驱动的,通常具有突发性且难以预测。单个请求可以带有不同的延迟、质量和成本要求,同时新兴应用,包括实时语音和视频、工业自动化等。 从超大规模扩展到多维扩展——人工智能基础设施的下一个时代 当前的人工智能基础设施投资周期阶段,其特点是资本、计算能力和能源的异常集中。微软、亚马逊、谷歌和Meta计划在2026年共同投入约6900亿至7200亿美元资本支出,尽管它们的会计定义和投资组合不能直接比较。微软已表示,其日历年度资本支出约为1900亿美元;亚马逊预计将在公司范围内投资约2000亿美元;谷歌给出的指引为1750亿至1850亿美元;Meta预计投资1250亿至1450亿美元,其中包括融资租赁的本金偿还。在每种情况下,运营人工智能基础设施都是核心投资驱动力。 旨在弥合计算供给与需求之间持续存在的差距的扩建计划。 该建设将持续进行。但建筑驱动力正开始从开发模型转向消费模型。Gartner预测,到2030年,超过80%的AI优化基础设施即服务支出将支持推理工作负载,而目前这一比例约为一半。诺基亚自身的展望也预计,在本十年末,60%至70%的AI工作负载将转向实时推理。 网络中 机器正在交谈。相互,并且它们会传递数据相当对称地各处。 诺基亚负责人工智能和高性能网络业务的克莱顿·瓦格(Clayton Wagar)将这一转变描述为市场的扩展,而非集中式基础设施的替代。“现实情况是,人工智能的消耗仍处于极其早期的阶段,”他说。尽管目前的AI体验通常由集中式云提供,瓦格警告说:“看到我们今天正在建设的庞大超级数据中心,并认为所有的推理都会发生在这里,这很诱人,但它并非如此。” 首要关注的是超大规模AI工厂——这些庞大且高度集成的计算环境旨在训练前沿模型、服务大型云客户并支持第一方AI应用快速扩展的产品组合。这些设施将GPU和其他加速器聚合到日益庞大的计算域中,通过规模扩展网络连接处理器、通过规模扩展织物连接机架,并通过跨域架构在楼宇、设施或园区之间扩展这些计算域。其结果是工业化的 — 克莱顿·瓦格,诺基亚人工智能与高性能网络业务负责人 推理并非单一的工作负载类别。大型推理模型可以从集中式算力中持续获益,在那里可以将请求分批处理,并使昂贵的加速器保持高度利用。其他 用例将受延迟、数据本地性或物理交互的影响。在工厂车间运行的机器人、实时视频系统以及人工智能赋能的工业控制系统往往无法容忍往返于遥远超大规模区域所需的时间。出于经济、监管或安全原因,企业也可能将推理(inference)更靠近专有数据。同时,各国正在建设主权能力,以将数据及人工智能处理保持在国家边界之内。 供应商——连接到一个更大的分布式AI系统。其雄心在于为从大型AI工厂到企业基础设施、基站计算(AI-RAN)或智能终端等资源提供可编程的连接。 新兴的AI网格提供了更广泛的编排概念;工作负载根据性能、成本、能源可用性、法规和业务政策进行迁移。多维扩展提供了执行这些部署决策所需的互连。正如瓦格所说:“AI网格的连接织物就是我们所说的多维扩展。” 这既改变了交通行为,也改变了网络需求。互联网在很大程度上是围绕人类消费和不对称、下载密集型流量而设计的。分布式人工智能将在应用程序、模型、存储系统、传感器和自主代理之间创造持续不断的交互。“我们将看到机器全天候、全年无休地相互交流,”瓦格说。 那块织物更像是一个方向,而非一座完成的建筑。常见的AI网络服务定义、跨域信令机制、商业模式和服务水平协议仍不成熟。这就是为什么诺基亚将多维扩展呈现为一个行业探索空间,而非一个独立的产品。超大规模建设确立了AI计算的供应;接下来的挑战是使该能力作为一个更广泛、可编程系统的一部分来运行。在这个转型过程中,规模将越来越衡量为跨多个领域的基础设施如何围绕工作负载的需求进行协调的有效性。 结果是一个覆盖人工智能工厂、区域和边缘云、企业园区、电信设施乃至终端用户设备的分布式连续体。相关的问题变成了如何为每个工作负载找到最佳运行位置,同时考虑延迟、主权、隐私、带宽效率、电力可用性以及提取或传输数据的成本。 能力仍然是基础,但原始带宽将不足。例如,工业自动化和物理AI将需要确定性性能、可控抖动、快速恢复和高可用性。动态放置将需要实时遥测和闭环自动化,以便根据工作负载意图调整网络路径、容量和政策。同样,安全也必须从物理基础设施和控制平面延伸到流量、数据和模型。 多维尺度分析描述了协调此环境所需的连接架构。扩展规模、横向扩展和跨域扩展使单个计算域变大。多维尺度分析则连接独立的计算域——这些计算域可能由不同的云、企业或服务运营。 人工智能时代的数据中心网络 为AI而生,迎接未来。 我们值得信赖的数据中心网络解决方案,为连接人工智能基础设施——包括数据中心内部、数据中心之间以及数据中心之外——提供了所需的可扩展性和效率。 从数据中心交换,到下一代光互联和AI增强型网络自动化,我们助您以当今最苛刻环境所需的高性能、可靠性与简易性,为AI工作负载提供强大动力。 协调计算是未来人工智能基础设施的限制。 诺基亚的多维尺度概念将连接性问题定义为:如何在人工智能工厂、区域云、企业环境和边缘位置等独立计算池之间建立连接,使它们能够作为更大系统的组成部分运行。但仅靠连接性并不能构建人工智能织物。一旦这些资源变得可达,就必须再增加一层来确定模型运行在何处、哪个加速器服务请求、哪些数据和模型状态需要随之移动,以及如何在这些放置决策中协调性能、成本和治理。 接收相对统一的需求,并且基本上是无状态的。大语言模型推理运行在昂贵的加速器上,接收长度和复杂度差异很大的提示,并且从保留状态中受益,特别是早期处理过程中生成的键值缓存。 传统的负载均衡器可以判断一个 Pod 是否可用,但它可能无法理解 GPU 内存是否已满、另一个节点是否持有热 KV 缓存,或者某个特定请求是否更适合分配到其他地方。其后果可能是缓存抖动、可避免的延迟以及利用率低下,即使集群内仍有可用容量也是如此。 关于如何智能地跨多个数据中心,从边缘到核心,在不同的一套硬件上转移、协调和调度请求……而这项智能需要一套完整的技术栈。 这就是红帽公司正在解决的问题。红帽全球电信行业CTO办公室的首席架构师阿图尔·德什潘德将公司的架构目标总结为“任何模型、任何加速器和任何云”。这个短语既概括了分布式推理中蕴含的机遇,也指出了其复杂性。该基础设施将按设计实现异构化,但用户仍然期望能在其上获得一致的运营环境。 “你需要一个能感知状态的路由器,”德什潘德说道。这种路由器可以在将推理请求导向合适的后端之前,考虑可用的GPU内存和缓存状态,同时保持所需的服务等级协议。这种区别很重要,因为分布式推理并不仅仅是将传统的应用调度应用于GPU。调度器还必须了解AI工作负载的内部特性以及底层基础设施的状态。 当前的挑战在于,生成式AI工作负载的表现与Kubernetes最初设计用来管理的云原生应用程序不同。传统应用程序通常在CPU上运行。 阿图尔·德什潘德,首席首席架构师,CTO办公室,全球电信,红帽公司 红帽公司提议的堆栈结构在分布式推理之上放置了一个AI网关。 加速器或部署位置将在人工智能应用的整个生命周期中占据主导地位。然而,它们可以建立一个操作层,该层保留选择并始终如一地应用策略。正如Deshpande总结的那样,“无论你选择何种架构,可移植性和治理应该是其中关键决策之一。” 为推理引擎。网关负责API管理、身份验证、令牌跟踪和计费等功能。在其下方,该平台支持经过验