您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:摩根士丹利科技论坛BrianNowak深度解析14万亿美元AI资本开支及20260807 - 发现报告

摩根士丹利科技论坛BrianNowak深度解析14万亿美元AI资本开支及20260807

2026-08-07 未知机构 CS杨林
报告封面

一、当前一、当前AI算力供需与资本开支路径算力供需与资本开支路径 1.算力仍处于供给约束状态,capex仍有上修空间行业仍处compute-constrained生态,算力价值高,新增容量决定超大规模云厂商增速与全行业AI 技术扩散速度。摩根士丹利维持对四大超大规模云厂商capex的高位预测:2026年合计约1.2万亿美元,2028年合计升至约1.4万亿美元。部分投资者较其预测还高出约2000亿美元/年,capex整体仍有上修倾向。2027年是本轮capex最后一个显著的二阶导上台阶,之后增量更多来自容量端释放,capex节奏将从硬件/半导体/内存逐步让位于软件互联网环节。2.2025-2028年算力容量约4倍扩张,2028年底合计115-120GW 范围涵盖Google、Amazon、Microsoft、Meta及SpaceX地面算力capex 。2025年合计capex约8000亿美元,2027年增至约1.2-1.3万亿美元,2028年达1.4万亿美元。Google与Amazon合计占每年capex的50%-60%,也是新增容量贡献最大的两家(约60%)。五家公司2025年底算力容量约10GW,2026年翻倍至约20GW,2027年再增30GW,2028年新增35GW。2025-2028年合计新增约85GW,到2028年底五家公司总算力达30GW的4倍,即115-120GW。容量排序:Amazon第一、Google第二、Microsoft第三、Meta第四、SpaceX地面算力第五;Google新增最多,预计2026年底至2027年初反超Microsoft Azure。 二、三套二、三套GenAI ROIC框架框架 1.IaaS(基础设施即服务)业务:增量ROIC约30%代表:AWS、Azure、GCP 向客户出租算力。收入端:每GW对应约230亿美元营收;核心假设为GPU正常运行时间(75%)以及GPU租金基础情形8.50美元/小时。成本端:GW对应capex约390亿美元,其中230亿美元IT capex按5年折旧,160亿美元非IT capex按15年折旧;能耗与其他opex约2美元/瓦。增量EBIT利润率约70%,增量ROIC约30%。2.自建算力上跑模型API:ROIC 最高、最具吸引力代表:Google自建数据中心跑Gemini、Meta自建算力跑Meta AI/Muse ,私有实验室自建数据中心。收入端:可获取API层溢价,单GW收入更高;不需支付第三方GPU租金溢价。成本端:同样承担GW对应折旧、能耗与其他opex,但无需向第三方付费。核心敏感性:①推理vs训练算力配比(训练不直接产生收入,但维持长期模型定价权);②token吞吐量与token定价之间的取舍(Amazon在最新季报中已强调此杠杆)。是三类业务中利润率与ROIC最高的一类。3.第三方算力上跑模型API:增量ROIC约25%以上 代表:模型实验室租用Hyperscaler或Neocloud 算力跑自家模型。收入端:单GW收入相对更高,因为本框架假设100% GPU uptime(对比自有算力情形的75%)。成本端:最大变量为GPU租金(直接对应Hyperscaler IaaS的收入);其余变量同样是推理/训练配比、token吞吐量与token定价。增量EBIT利润率约30%,增量ROIC约25%以上。 三、关键驱动变量与框架的灵活性三、关键驱动变量与框架的灵活性 1.开源/开放权重模型对ROIC的影响有限Brian观点:开源模型仍需算力,而Hyperscaler掌握算力入口,不会做损害unit economics 的交易。增量bottom-line unit economics仍可能为正,营收节奏可能从30%+ ROIC回落至20%+,但以更高交易量弥补。Nikhil补充:开源模型通常参数更小(如DeepSeek V4为1.6万亿参数模型),反而token吞吐量更高,可补偿定价端的劣势。自研芯片(如TPU、Trainium)有望成为Hyperscaler在开源场景下拉高吞吐量的关键杠杆。2.GPU 租金长期会回归平衡,短期仍有供给缺口溢价行业仍处算力紧张状态,Amazon自报需求已排到2-3年后,Microsoft 管道类似。短期内不会再出现30-50美元/瓦的极端高价,租金中枢将随产能释放而下移,但供需失衡仍将维持租金紧平衡。 Meta的Neocloud定位是”Plan B”:可能用可能用H100等旧芯片而非等旧芯片而非Blackwell做短期租赁做短期租赁,但不构成估值的核心驱动力;Meta AI产品与API在2027年之后的兑现才是真正驱动股价的关键。 3.推理与训练算力配比:推理占比将持续上升当前推理占算力约50%-60%,长期方向是继续上行,但短期内不会达到100% ,因为前沿模型仍需继续投入大模型预训练。算力可替代性较高:大型GW级数据中心通常先用于训练集群,后续可逐步切向推理;GB300等当前最强芯片主要被用于预训练,下一代Rubin等推出后GB300才更可能用于推理。由于GB300集群当前主要跑训练,GB300实际定价数据仍不透明。4.芯片代际升级与单GW组件成本通胀 团队与覆盖半导体的Joe Moore团队合作,覆盖从Blackwell到GB300、Rubin、Fine Man 等代际的吞吐与成本演进。即使单GW capex随代际上升,token吞吐量的提升与可货币化的能力升级仍能维持有吸引力的uniteconomics。自研芯片(Trainium、TPU等)的进展对Google与Amazon的unit economics有显著杠杆作用。5.Capex per Gigawatt与内存通胀 团队维护Hyperscaler capex per gigawatt文件,覆盖TPU、Trainium3以及NVIDIA H100至Rubin Ultra 等代际。数据来源:亚太半导体团队的rack BOM(如Howard Chow团队对GB200、GB300、Vera Rubin的拆解)。内存约占rack成本25%,IT成本约占GW总成本60%;GW级BOM中约15%-20%锁定在内存。Rubin较GB300在DDR5、HBM、SoCAM等各类内存上均有所增加,是单GW capex通胀的主要来源之一。在ROIC框架仍具备吸引力的前提下,Hyperscaler对内存等组件涨价的承受能力较高。6.ROIC兑现的可见路径 收入侧:AWS、GCP、Azure的关键KPI 增长加速;增量需求随产能释放而释放。在compute-constrained环境下,年增速是产能投入的”输出”,应更关注环比美元增量而非同比增速。利润侧:超大规模云厂商50%+增量EBIT利润率有望维持甚至向50%高位靠近。订单储备(backlog)是未来增长的领先指标;行业应用(医疗、金融、工业、能源等)的具体落地是判断能否继续从硬件轮动到软件层的关键依据。 四、四、Neocloud与与AWS利润率可持续性利润率可持续性 1.Neocloud的角色:短期释放阀,长期被Hyperscaler收回在极端算力约束期,任何持有算力的Neocloud都有市场需求;早先以较低价格售出算力的Neocloud 可能有所后悔。Amazon、Google长期倾向于自建算力;Meta则可能延续混合模式,保留与Neocloud的长期合同(4-5年低价锁定),不排除将API托管在Hyperscaler。短期内Neocloud对盈利是正面贡献,中长期看是阶段性”释放阀”。2.AWS 50%增量利润率的可持续性 团队认为50%增量利润率具备可持续性,但不预计AWS报告口径利润率在2028年达到55% 。支撑因素:①二季度首次体现裁员后的成本基础;②H100、Blackwell预留实例提价的能力;③Bedrock净会计法(API负载按净额计入)的高margin属性;④非AI业务(存储、Graviton、基础推理等)随AI客户采用而上行,结构性正向贡献。团队预计AWS报告口径利润率逐步走向40%区间,具体节奏取决于管理层在产品/价格上的再投资决策。 Q&A 1.Q:开源:开源/开放权重模型若抢占份额,对超大规模云厂商开放权重模型若抢占份额,对超大规模云厂商ROIC影响几何?是否影响计算强度与定价?影响几何?是否影响计算强度与定价?A:Brian:开源模型仍需算力入口,Hyperscaler不会做损害unit economics的交易;增量bottom-line 仍可能为正,可能从30%+ ROIC回落到20%+区间,但靠量弥补。Nikhil:开源模型参数更小,token吞吐量天然更高,可部分对冲定价劣势;自研芯片(TPU、Trainium)也是重要杠杆。::GPU租金将如何演化?算力大量上线后旧芯片租金会否断崖?如何看待租金将如何演化?算力大量上线后旧芯片租金会否断崖?如何看待Meta潜在的潜在的Neocloud 2.Q机机会?会?A:Brian:供给释放后租金中枢会回落,30-50美元/ 瓦的极端价位不可持续,但供需失衡仍将维持租金紧平衡;ROIC框架并不依赖极端租金。Meta的Neocloud是Plan B,可能用于H100等旧芯片而非Blackwell;Meta股价的真正驱动仍是2027年之后Meta AI产品与API的兑现,Neocloud只是提供盈利底。:模型中长期推理:模型中长期推理vs训练负载的配比如何假设?两类负载的训练负载的配比如何假设?两类负载的margin profile 3.Q有何不同?训练集群后续能有何不同?训练集群后续能否转作推理?否转作推理? A:Nikhil:训练本身不直接产生收入,是维持模型长期定价权的必要投入;当前推理占比约50%-60%,长期上行但不会到100%。算力可替代性高,GW级集群通常先用于训练集群,再逐步切换至推理;GB300当前主要跑预训练,定价数据仍不透明,下一代Rubin推出后GB300或更多用于推理。:投资人何时能看到:投资人何时能看到ROIC更明确的信号?更明确的信号?ROIC的盈亏平衡是的盈亏平衡是2028还是还是2029 4.Q??A:Brian:未来几个季度将看到关键KPI加速增长(AWS、GCP、Azure);compute-constrained 环境下应关注环比美元增量而非同比增速。增量EBIT利润率50%+(甚至50%高位)有望延续;backlog是领先指标;行业垂直应用(医疗、金融、工业、能源)落地是能否继续从硬件轮动到软件层的关键。:芯片代际升级(:芯片代际升级(Blackwell→GB300→Rubin→Fine Man)对)对unit economics的影响?的影响?NVIDIA 5.Q在吞吐上在吞吐上的领先能否抵消单的领先能否抵消单GW成本上行?成本上行?A:Brian/Julian:单GW capex会上升,但token吞吐与可货币化能力提升足以维持有吸引力的unit economics;NVIDIA在吞吐侧仍领先于自研芯片。自研芯片(Trainium、TPU)的进步对Google、Amazon的unit economics是重要补充。::capex per gigawatt的关键假设?内存通胀多大?的关键假设?内存通胀多大?Hyperscaler 6.Q对组件涨价的承受能力?对组件涨价的承受能力?A:Nikhil/Julian:模型覆盖TPU、Trainium3与NVIDIA H100至Rubin Ultra;内存约占rack成本25%,GW 级BOM中15%-20%锁定在内存;IT成本约占GW总成本60%。Rubin较GB300在DDR5、HBM、SoCAM等各类内存上均有增加,是单GW成本通胀主因;只要ROIC仍具吸引力,Hyperscaler对组件涨价的承受意愿较高。::Hyperscaler与与Neocloud 7