您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 人工智能基础设施的实际成本:本地部署与云部署的总体拥有成本分析 - OLDS Research | 发现报告

人工智能基础设施的实际成本:本地部署与云部署的总体拥有成本分析

信息技术 2026-08-27 - OLDS Research 还是郁闷闷啊
报告封面

本地部署与云部署的TCO分析 2026年5月 执行摘要 过去几年里,随着人工智能从实验阶段发展到试点项目,并最终让组织认识到其带来的效益足以证明投入巨资的合理性,一个转折点已经出现。这时,人工智能就成为了基础设施。 未来几年,我们认为人工智能不会作为一个独立的“事物”被讨论。像机器学习、深度学习和生成式人工智能这样的人工智能特性将被整合到任何有意义(以及许多可能没有意义)的应用或工作流程中。 2025年,仅全球AI基础设施市场(AI硬件,非设施)就达到了3180亿美元,根据IDC的数据,这一数字是2024年1530亿美元的两倍多。预计这种情况在可预见的未来仍将持续。 当前许多组织正苦苦思索的问题,并非“是否”需要人工智能基础设施,而是“如何”以及“在哪里”构建的问题。 “什么”问题高度依赖于独特的组织因素,例如他们认为对业务而言哪些是唾手可得的AI成果,以及他们希望采取多大的行动。 在本报告中,我们针对“在哪里”的问题,探讨了本地部署与公共云选项及其各自的成本。 我们比较了在本地部署和运营大规模生产级AI基础设施与在三大主要云平台(亚马逊网络服务AWS、谷歌云平台GCP和甲骨文云基础设施OCI)上部署和运营的估算成本。该比较是公平的,基于公开的定价和明确定义的负载假设。该模型假设一个由248个GPU组成的企业级AI集群处于稳定状态,全天候(24/7)运行。 该场景考察一个成熟、多元化的制造组织,该组织已经在多个业务单元完成了广泛的AI试点项目。 这些努力已在缺陷减少、调度、供应链优化以及AI增强的高性能计算工作负载等方面展现了可衡量的运营改进。基于已验证的需求,该组织正在评估一个 集中式共享AI基础设施,以支持持续的模型训练、测试和开发。 云配置在承诺价格下提供相当的性能和持续的企业级容量。所有成本均基于分析时公开可用的价格来源。 在此情况下,成本差异相当显著。据估计,在三年期间,云选项的成本平均比本地部署高出3.5倍以上。在五年期间,这种差异会进一步扩大。 成本差异是租购经济学的例证。简单来说,如果你频繁使用某物且其成本很高,那么在大多数情况下,购买它比租用它更有利。 如果您更改了需求和假设,数字会随之改变,有时决策也会改变。在本报告中,我们明确陈述了需求和假设,配置本地和云服务提供商(CSP)环境以最好地满足条件,然后进行成本核算。 目录 为何此报告,为何此刻? .................................................................................................. 5 为何此报告,为何此刻? 每一位哪怕只是偶尔关注过商业或科技的人都清楚,我们正经历一场巨大的变革,旨在将人工智能功能添加到商业的几乎所有方面。 当前许多组织正苦苦思索的关键问题是,如何添置必要的技术以支持其人工智能计划。他们是应该向现有数据中心添置新的服务器、GPU和基础设施,还是应该租用云端的服务能力?而在两种情况下,他们又能期望支付多少费用? 我一直很好奇,在本地运行严肃的 IT(以及现在的 AI)基础设施,与在公共云中运行,其真正成本到底有何不同。 云服务定价是公开的。任何人都可以进入亚马逊云服务(AWS)或谷歌云定价工具,模拟详细的配置。但获得一个完全搭建好、企业规模的本地数据中心并附带真实价格,要困难得多。没有这些信息,苹果对苹果的比较很大程度上只是猜测。 企鹅解决方案也对同一个问题感兴趣。人工智能投资的激增创造了一波基础设施决策点,组织们正积极讨论其长期人工智能骨干应部署在何处。企鹅资助了我进行详细成本分析所需的时间,以评估一个包含248个GPU的本地集群,并将其与亚马逊云科技、谷歌云和甲骨文云进行比较。 rõ ràng, Penguin đã cung cấp một cấu hình phần cứng chi tiết và mức giá tương ứng cho hệ thống tại chỗ. Tôi đã xây dựng các mô hình đám mây bằng cách sử dụng các công cụ định giá công khai. Tôi đã xác định các giả định về công việc, mô hình sử dụng, yêu cầu lưu trữ và mạng, và thực hiện so sánh chiphí. Phương pháp luận và kết luận trong báo cáo này là của tôi. 以往在高性能计算和基础设施经济学领域的工作让我对这可能会如何发展有了总体认识。其背后的经济原理并不神秘。如果你去一个城市旅游一周,你会订酒店。如果你要住一年,你会租公寓。如果你打算长期定居,你会买房。需求越长期、越稳定,拥有资产的经济理由就越充分。 那并不意味着酒店是错的。我们绝对需要酒店。我们也需要公寓和房子。但一种模式并不适用于所有情况。人工智能基础设施也是如此。 但类比并非分析。本报告的目的是超越直觉,在明确界定的现实条件下进行计算。 构建模型 我们进行这项比较的方式与评估任何基础设施的方式相同:首先定义工作负载,然后构建支持该负载的系统。 该模型假设在一个成熟的全球制造组织中,有一个由248块GPU组成的集中式AI集群,为多个业务部门提供持续使用、高利用率及24小时7天不间断运营服务。利用率模型设定约为80%,反映了跨一系列正在进行的AI计划的总需求。 云配置已构建,以匹配相同的GPU数量、存储容量和整体性能范围。未使用任何竞价实例或可中断容量。 我选择了亚马逊AWS、谷歌云平台和甲骨文云基础设施,因为它们拥有配备NVIDIA B200 GPU的x86 CPU实例。在我们的研究期间,微软Azure没有提供这些实例。我们也没有分析规模较小的人工智能专业云服务提供商,因为它们相对规模较小且进入市场较晚。 对于未提供三年承诺定价的发布情况(AWS B200和OCI),我们根据历史先例和典型企业谈判模式,采用了保守的折扣假设。这些假设在相关部分有明确说明。 五年总计是通过线性延伸月度定价计算的。为什么是五年而不是三年?因为主要的云服务提供商已经将其服务器折旧周期延长至五年,并且企鹅解决方案的本地配置包括五年的故障维修服务覆盖。 不涉及关于重新谈判、未来价格下调或硬件更新周期的任何假设。供应商根据交易规模、时机和内部收入目标进行定价谈判,这是常有的事。但这属于此模型的范围之外。 全球假设与建模边界 连续24/7稳态运行: 大型跨国公司通常同时开展多项人工智能工作。其中一些是早期试点项目,另一些处于测试阶段,还有一些是全面的训练或再训练工作负载。这个集群主要用于人工智能的开发和训练。它也能处理推理工作负载,但推理需求因模型和部署模式而异,因此我们在此不考虑它。 集群利用率假设: 利用率是在聚合集群层面进行建模的,而不是针对每个单独节点。我们使用80%作为平均集群利用率。这个想法是反映多个并发计划的总需求,而不是假设每台GPU在任何时候都处于完全饱和状态。在集中式HPC和企业AI环境中,当基础设施是根据验证过的需求进行配置而不是投机性增长时,75%至85%范围内的持续利用率并不罕见。该模型展示了实际运行情况。 高性能基础设施配置: 人工智能训练工作负载计算密集,需要高度集成、高性能的基础设施——本质上就是超级计算机级别的系统。同等配置可从本地供应商和云服务提供商处获得,云模型也是据此构建的。 无现货或抢占式容量 本地系统为用户提供7×24小时服务,因此CSP的配置也遵循相同的标准。这里建模的许多工作负载会持续运行数天甚至数周。允许中断需要频繁进行检查点操作,这会增加开销和成本。此外,竞价市场的价格和可用性波动也很大,这使得它们更适合短期或突发式工作负载,而不是需要持续高利用率的生产环境。 三年承诺价格,如适用 承诺定价提高了成本可预测性,并降低了云支出。在某些情况下,高需求的GPU实例仅在保留或承诺协议下提供,因此这一假设模拟了大型企业实际采购云基础设施的方式。 此模型试图未能捕捉的内容 • 超出基础系统管理工具的软件或应用程序许可。• 管理服务。这些服务广泛可用且可定制,但它们不在此基础设施成本比较的范围内。由于CSP基础设施本身包含硬件支持,因此本地系统包含拆解/修复服务。 人工智能基础设施配置基线 在比较具体的供应商实现方案之前,重要的是要定义所有场景中使用的通用配置基准。目标不是模拟一个假设的超大规模环境或一个小型实验集群,而是一个符合已验证需求的、严肃的、大规模的企业级部署。 这种配置假设一个大型成熟的组织将人工智能开发和培训工作负载整合到一个集中的共享资源中。它有意足够大,以揭示有意义的成本差异,但又不会大到代表超大规模基础设施。 该配置围绕248块NVIDIA B200 GPU构建,部署为31个节点,每个节点配置8块GPU。 B200系列因其是一款广泛可用、经过生产验证的GPU架构,并且被选定的云服务提供商和本地供应商所提供,因此被选中。 建模时,B300级系统虽已出现,但在各供应商中尚未普遍采用且配置可比。使用B200 GPU可以实现一致且公平的比较。 未来的GPU代产品将提升每瓦和每美元的性能。这种提升对租赁和拥有模式都有益。此处关注的是持续使用下的成本结构,而非代际基准比较。 选用 248-GPU 规模是为了代表一个规模可观且切合实际的商业部署。这个规模足以支持企业内部多个并发的人工智能项目。 用于强调经济模式,但规模并未达到超大规模数据中心的程度。 存储性能基线 AI训练工作负载需要高吞吐量、并行存储,能够持续处理流向GPU节点的海量数据。存储系统必须提供足够的数据以保持GPU的高利用率并避免闲置。基准配置假设云环境中存储性能达到每TiB约250 MB/s,与企业级管理型并行文件系统层级相一致。 本地存储配置为采用水平扩展架构,以提供相当或更高的总读写吞吐量。其目的并非针对任何单一供应商的峰值性能进行优化,而是确保所有配置均满足适用于大规模人工智能训练工作负载的、一致的性能范围。 容量和吞吐量均经过设计,以避免在任何环境中出现瓶颈。存储容量设置为2.5拍字节的可用空间。 该基准有意侧重于人工智能开发和训练工作负载。推理环境因模型大小、部署模式和延迟要求而差异显著,使其高度特定于工作负载,并且在此规模下不太适合进行通用成本建模。 网络连接要求 大规模人工智能训练依赖于GPU节点之间的高带宽、低延迟互连。基准假设了适用于分布式训练工作负载的高性能网络。 本地配置采用在HPC级部署中常见的现代高速互连技术。云配置则选用以在单个区域内提供相当集群内网络能力。 所有场景均假定整个集群在单个区域或数据中心环境中运行,以避免跨区域延迟惩罚并保持训练效率。 此配置是为分布式、多节点训练工作负载优化的,而非单节点微调任务。虽然可以容纳较小的微调作业,但该集群的规模和互联设计是为了支持跨多GPU的大规模同步训练运行。 性能等效 所有供应商配置均旨在满足相同的一般性能和容量目标。其目的并非声称任何部署模式具有架构优势,而是要定义一个一致的基本标准,以便成本比较能够反映经济结构而非配置差异。 这是一个成熟企业所需的、现实的企业级AI基础设施基线,其中AI模型需要在大规模下进行测试和训练。 在本地和云环境中配置同等能力的系统并非易事。物理基础设施和云定义实例之间的术语、规范和包装存在显著差异。即使在云服务提供商之间,对于实例和性能特征的描述方式也存在有限的共性。 因此,以下各节明确阐述了每种配置的构建方式。虽然具体实现方式有所不同,但每种配置的设计都旨在达到相当的性能预期。 本地配置:企鹅解决方案 OriginAI 基础设施 本次分析中的本地配置基于Penguin Solutions提供