我将围绕硬件路线、元件供需及价格主题整合报告,先梳理头部厂商3-5年GPU/TPU公开技术路线,涵盖谷歌、英伟达、AMD的对应产品。我已敲定报告的整体结构,将按技术路线、硬件架构调整、元器件需求量、BOM成本变动的顺序整合内容,已拟定开头表述,所有内容将匹配对应角标,不添加额外信息。
我已梳理出头部厂商算力芯片的迭代路线:谷歌TPUv7将在2023-2025年落地,2026年Anthropic将采购近百万颗该芯片,后续第8代TPU计划2027年推出对标英伟达Vera Rubin平台;英伟达2026年将推出Rubin GPU配套Vera CPU的新平台,该平台将成为其市场反击的核心产品。
AMD GPU系列明确了2027、2028年的两代迭代规划,目前暂未披露其后续产品的细分参数,待厂商正式发布后将进一步明确,后续需针对不同代际GPU、TPU的迭代需求调整整机硬件架构。
TPU v7采用高度集成的机架架构设计,配套组件与板载芯片互联规格均有明确配置,同时升级PCB适配高传输要求。
TPU v8采用双子架构设计,调整整机算力配比,新增独立协调芯片层,同时升级外围架构适配集群扩张需求;英伟达GH200 GPU阶段采用1:1的CPU-GPU配比,搭配高规格硬件与高速互联总线,适配高算力协同需求。
后续英伟达Vera CPU配套Rubin GPU阶段,整机调整为1:2的CPU-GPU配比,升级定制CPU、提升互联带宽,同时优化CPX GPU的散热与硬件设计,AMD也同步配套了对应GPU的整机机架方案。
为适配2027-2028年的800V DC原生计算平台,整机将完成通用架构升级,调整降压布局、取消机柜侧电源搁架、压缩低压传输范围,后续算力与整机架构迭代将带动核心元器件单台需求量攀升。
HBM内存作为核心元器件,其代际升级将同步提升容量与带宽,不同厂商的高规格HBM产品随GPU迭代不断跃升,支撑新一代算力提升。
谷歌TPU的HBM规格也伴随代际迭代显著提升,当前AI集群HBM总使用量可观,新代际产品单芯片HBM占用量较早期有数倍增长。
我还梳理了另外两类AI算力硬件的耗材需求趋势:一是芯片电感,其用量与芯片TDP呈正相关,新代际高算力芯片的电感需求量同步走高;二是PCB及配套载板,单GPU模组的PCB相关部件价值和用量随代际升级明显增长。
AI芯片ABF基板产能消耗占比高,单台AI服务器用量随代际提升,高端PCB铜箔需求也因新代际AI芯片升级大幅上涨。
除此前提及的ABF基板、高端铜箔材料需求上涨外,新代际AI芯片还拉动配套CPU算力需求显著提升,同时高速接口相关部件的用量与性能也随GPU/TPU代际升级同步优化,支撑更高的跨芯片、跨节点数据传输带宽。
成本相关情况梳理结果显示,AI服务器核心元器件BOM占比随产品迭代动态变化,英伟达GPU及相关配套组件占比超八成,是非GPU BOM占比提升的核心基础。存储类部件的BOM占比及不同AI服务器的SSD成本占比均有明确差异,先进封测环节的价值量已追平先进芯片制造环节。
受技术迭代与行业供需影响,核心元器件价格呈明确上涨趋势:一是内存/存储成本持续激增,2025年第四季DRAM与HBM合并合约价涨幅可达50-55%;二是先进封装价值占比持续提升,已跃升为和先进制程同等重要的高价值环节。
光芯片等配套核心部件的成本占比会随光模块速率提升进一步上涨,我已完成内容校验,确认内容符合输出要求。
从头部厂商公开的未来3-5年GPU、TPU技术路线出发,可以自上而下梳理出AI算力平台的硬件迭代方向,以及对应核心元器件的需求与成本变动规律。
当前头部厂商的算力芯片迭代节奏清晰,谷歌TPU系列方面,TPUv7将在2023-2025年完成技术落地与方案标准化,获得外部客户认可,2026年Anthropic将采购近100万颗该款Ironwood AI芯片,依托谷歌成熟的光互联Scaleup超节点网络部署 【3】 ;后续第8代TPU计划2027年推出,直接对标英伟达Vera Rubin平台,TPU超节点的整体性能指标将进一步优化提升 【12】 。英伟达GPU产品线方面,Rubin GPU配套Vera CPU将于2026年落地,配套的Vera CPU升级为88核定制ARM架构,NVLink-C2C互联带宽从前代的900GB/s提升至1.8TB/s,二者搭配组成Vera Rubin NVL144系统,CPU与GPU配比调整为1:2,Rubin平台2026年启动出货后将成为英伟达发起市场反击的核心产品 【13】 【8】 。AMD GPU系列遵循一年一代的迭代节奏,Instinct MI500系列计划2027年正式问世,配套Helios 500机架级系统,搭载EPYC 9006 LP "Verano"处理器,搭配Pensando "Como"和"Monza"网络芯片 【6】 ;后续Instinct MI600系列计划2028年推出,配套Helios 600机架级系统,搭载Zen7架构的"Ferrara" CPU,搭配Pensando "Palma"和"Levanzo"网络芯片 【7】 。目前公开披露的资料暂未覆盖上述后续迭代产品的完整制程、显存容量、峰值算力等细分参数,相关细节待厂商后续正式发布后会进一步明确。
针对不同代际GPU、TPU的迭代需求,整机硬件架构也需要做出针对性的适配调整。TPU代际迭代过程中,TPU v7阶段采用高度集成的机架架构设计,整机由16个TPU托盘、16个液冷/8个风冷主机CPU托盘,搭配顶部架顶交换机、电源单元、备用电池单元共同组成;每个TPU托盘内置TPU板,板载4颗TPU v7芯片,每颗芯片配置4个OSFP连接器用于芯片间互联、1个CDFP PCIe连接器完成和主机CPU的通信,同时同步升级PCB规格,适配算力、内存指标提升带来的高传输要求 【17】 。到TPU v8阶段,一方面针对训练路线的v8t、推理路线的v8i双子架构,调整整机算力配比,采用TPU与CPU 1:2的配比设计,把原本仅做请求转发的CPU升级为承担工作负载调度、遥测数据收集、跨节点数据移动的独立“协调器”角色,新增独立的协调芯片层设计 【18】 【22】 ;另一方面整机外围架构同步升级,新增OCS全光交换机、液冷系统、配套升级电源及光通信模块,适配TPU集群的规模扩张需求 【16】 。
主流GPU代际迭代过程中,英伟达Grace CPU配套GH200 GPU阶段,整机采用1:1的CPU-GPU配比,配置72核ARM Neoverse V2架构的Grace CPU,搭载480GB LPDDR5X内存,通过NVLink-C2C总线实现900GB/s的CPU-GPU互联带宽,适配AI数据中心的高算力协同需求 【13】 。到英伟达Vera CPU配套Rubin GPU阶段,整机调整为1:2的CPU-GPU配比,升级为88核定制ARM架构的Vera CPU,将NVLink-C2C互联带宽提升至1.8TB/s,实现系统级算力均衡,适配推理与智能体工作负载的复杂调度需求 【22】 【13】 ;同时针对CPX GPU的高功耗特性,将原风冷方案切换为液冷设计,采用CPX和CX-9共夹一个液冷冷板的结构,升级背板连接器减少线缆使用,同步将PCB层数从24层HDI升级为26层,新增PCIE Gen6链路适配Vera-CX9之间的高速数据传输 【24】 。AMD GPU迭代也同步配套对应的整机机架方案,匹配GPU的算力升级节奏 【6】 。面向2027-2028年即将导入的800V DC原生计算平台,整机还将完成通用架构升级,把800VDC的降压位置从传统机柜内的集中式电源搁架下沉至计算刀片内部,由板载隔离DC/DC模块就地将800V直流转换为48/50V,再通过后续IBC和VRM/PoL向算力芯片供电,取消机柜侧的800V→50V电源搁架,释放更多空间给计算和交换设备,同时把48/50V低压大电流的传输范围压缩到单刀片内部,减少铜排、连接器的使用量与导通损耗,适配新一代高功耗AI算力芯片的供电需求 【19】 。
算力芯片与整机架构的迭代,直接带动各核心元器件的单台需求量同步攀升。HBM内存的容量、带宽随代际升级大幅跃升,新代际产品的单芯片HBM占用量较早期产品有数倍增长,20万GPU规模的AI集群HBM总使用量可达200PB 【33】 【18】 【30】 。芯片电感的用量和芯片TDP呈近似线性正相关,随着新代际GPU、TPU功耗大幅上涨,电感用量同步持续走高 【31】 。PCB及配套载板的用量与价值也随代际升级明显增长,新代际AI芯片的ABF基板单芯片面积是消费PC端的8至12倍,即使AI类GPU/ASIC出货量仅占整体基板出货量35%,也会消耗超70%的整体ABF产能,高端HVLP4铜箔的需求量也大幅上涨,仅英伟达Rubin单系列产品月需求就接近1000吨 【34】 【18】 【35】 。伴随Agent类AI场景兴起,同等功率规模下每吉瓦数据中心所需的CPU核心数从传统的3000万跃升至1.2亿,整体配套CPU算力需求有约4倍的结构性增长,单台服务器对应的配套控制芯片用量较前代产品大幅提升 【29】 【18】 。同时新代际GPU配套的专用高速网络芯片也同步迭代,单台AI服务器的高速接口、网络互联芯片的数量和性能都随算力芯片代际升级同步提升,支撑更高的跨芯片、跨节点数据传输带宽要求 【6】 。
从BOM成本结构来看,不同核心元器件的占比随迭代持续动态变化。以英伟达DGX H100整机为例,GPU+NVSwitch合计占整机BOM的比例高达86.46%,是绝对的成本核心 【42】 。非GPU BOM占总BOM的比例随产品迭代有所提升,VR200中该部分占比约70%,GB200、GB300中该占比分别为72%、75% 【37】 。存储类部件的占比在不同产品中差异明显,训练型AI服务器的SSD成本占比约4.2%,推理型AI服务器的SSD成本占比可达27.7% 【40】 。先进封测环节的价值量已经追平先进芯片制造环节,英伟达B200 GPU中,单颗CoWoS及测试成本达1367美元,已经接近先进制程芯片制造环节的1500美元/颗 【45】 。伴随技术迭代,核心元器件的价格也呈现明确的上涨趋势,内存/存储配置多重升级带动内存BOM成本大幅上涨,叠加行业供需紧张的大背景,2025年第四季DRAM与HBM合并的整体合约价涨幅可达50-55% 【37】 【46】 。先进封装的复杂度、技术壁垒同步大幅提升,在GPU/TPU整机BOM中的占比持续走高,同时光芯片的成本占比会随着光模块的速率提升同步上升,在高速AI算力配套的光模块中,光芯片的成本权重会进一步提高 【45】 【39】 。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803