将整合GPU、TPU路线图相关内容为连贯报告的需求已明确,报告框架已敲定,开篇表述也已确定,将按规划完成内容梳理。我将先梳理技术路线核心要点,分谷歌TPU、英伟达GPU、AMD GPU及全行业共性内容呈现,配套相关参考标识。英伟达持续迭代GPU互联方案,降低集群互联硬件成本占比,提升万卡集群算力协同效率,下一代GPU将升级配套超大规模AI集群互联方案;AMD按年度迭代GPU产品,2027-2028年推出新一代加速器及全栈解决方案。全行业层面,芯片制程将向2nm演进,2nm相较3nm可提升10-18%性能、降低36%功耗,高速互连技术也将分阶段迭代,2026-2028年NPO、CPO大规模应用于万卡级AI算力集群,2029-2031年CPO成市场主流,远期将落地OIO芯片级光互连架构。接下来将分析技术升级带来的硬件架构调整。
AI加速芯片的硬件架构调整将从两个维度推进:一是计算核心与适配能力升级,端侧NPU支持多类主流模型架构,新型计算架构实现商用突破,云侧平台适配动态AI工作负载需求;二是封装与存储配套升级,多芯粒封装成为主流,搭配高规格HBM内存,适配多类下游部署要求。
外围接口与配套硬件、高速互连架构的升级方向已明确,后续硬件元件需求量将迎来结构性增长。
GPU与TPU的硬件需求已明确增长方向:GPU总出货量有望达1640万台,2030年相关芯片出货量将突破4000万颗,CPU配对、存储、互连结构件等多类配套需求均出现结构性爆发,ABF基板产能消耗受AI端需求拉动尤为显著。
关于TPU的相关需求情况,我已经梳理完成:2027年TPU相关产品在博通、联发科平台的上量规模,CPU与TPU配比率的提升,新增独立协调芯片带来的产业链需求外溢,以及不同版本的HBM规格、2-die小芯片的需求增长情况,都已明确。
成本拆分部分的过渡句已敲定,以B200 GPU为例的核心元件成本构成已明确,HBM是其最大成本来源,该趋势在2026年上半年进一步强化。
当前AI服务器整机成本结构显示,存储系统占比已提升至30%-35%,HBM成为和GPU并驾齐驱的核心算力资产,不同场景的AI服务器成本结构差异明显;整机架维度下,定制ASIC机架的每吉瓦成本仅为同期英伟达GPU机架的1/3到1/2,下一代英伟达GPU机架成本也有一定程度下降。
单位芯片TCO对比显示,TPU资本成本占比约72.7%,英伟达GB200/GB300达77.4%-79%,GPU硬件采购成本占比更高。目前公开资料暂未覆盖所有代际相关芯片的全元件采购价完整拆解,上述内容为当前可获取的核心行业参考,我将整理为通顺的完整内容。
我们可以基于头部厂商GPU、TPU未来3-5年的公开技术路线,自上而下梳理对应的硬件迭代方向、各版块元件需求量以及成本拆分情况,为AI算力产业链的布局提供参考。
从核心厂商的技术路线迭代要点来看,谷歌TPU系列2027年将推出第8代产品,直接对标英伟达的Nvidia Vera Rubin,TPU超节点的整体性能指标会得到进一步优化提升 【5】 。目前谷歌已经完成了光互联Scaleup网络的技术路线探索和方案标准化,后续迭代的TPU超节点将持续沿用这套成熟的光互联架构,支撑万卡级集群的大流量数据交互需求 【10】 。同时TPU的商业化进程明显加速,此前TPUv7已经获得外部客户认可,2026年Anthropic就将直接采购近100万颗TPU v7 Ironwood AI芯片,后续新一代TPU也会从过去主要服务谷歌自身生态的定位,进一步开放对外商业化落地,将自用优势转化为对外竞争的核心武器 【1】 【5】 。英伟达GPU方面,其NVLink+NVSwitch体系会持续向更高带宽、更低配比的方向迭代,从当前Blackwell GPU的NVLink5.0+第四代NVSwitch方案(GPU与28.8T NVSwitch配比为1:0.25)持续优化,进一步降低集群互联的硬件成本占比,提升万卡集群的算力协同效率,下一代GPU架构演进还会搭配先进封装技术升级,配套超大规模AI集群互联方案,突破算力与能效的瓶颈,释放更大的集群算力上限 【4】 【15】 。AMD GPU则遵循一年一代的更新规律,2027年推出下一代Instinct MI500系列显卡加速器,2028年迭代至Instinct MI600系列,对应GPU产品同步推出Helios系列机架级全栈解决方案,实现CPU、网络芯片的全栈算力体系同步迭代 【7】 【9】 。全行业层面也有明确的共性迭代方向,芯片制程将从当前的3nm逐步向2nm演进,2nm技术相较3nm可实现10–18%的性能提升,同时降低36%的功耗,进一步优化芯片的PPA(性能、功耗、面积)表现;高速互连技术也分阶段推进,2026-2028年作为技术过渡期,NPO、CPO产品会大规模应用在万卡级AI算力集群,2029-2031年CPO方案将成为高速互连市场的主流产品,远期还会落地OIO芯片级光互连架构,彻底打开万卡集群的算力释放上限 【6】 【8】 。
为了匹配上述技术路线的升级要求,AI加速芯片的整体硬件架构也会从多个维度做出针对性调整。首先是计算核心与适配能力升级,端侧场景下新一代NPU架构不再局限于传统卷积神经网络的加速,拓展为支持Transformer、图神经网络等多种主流模型架构,同时存算一体、近数据计算等新型计算架构开始商用落地,突破冯·诺依曼架构的算力瓶颈,为端侧AI提供更强算力支撑;云侧AI加速平台中,定制化AI加速器会加入更多SRAM,同时嵌入CPU单元,CPU不再只是传统服务器的组成部分,而是以芯粒或多芯片封装形式融入AI加速平台,承担起连接不同计算单元、调度系统资源的核心作用,适配推理、智能体应用普及后愈发动态的AI工作负载需求 【17】 【19】 。其次是封装与存储配套升级,从2026年起AI芯片进入GPU与ASIC双轮驱动阶段后,芯片普遍向多芯粒封装演进,同步搭配更高规格的HBM系列高带宽内存,整体内存容量、带宽随芯片代际同步跃升,同时多级内存系统的设计也会同步适配下游GPU/ASIC设计、互连标准以及云服务商的部署策略调整 【16】 【25】 。第三是外围接口与配套硬件升级,随着AI加速芯片性能提升,内存通道、PCIe/CXL接口规格同步升级,带动PCB/CCL、电源、散热等配套硬件同步迭代,PCB板上芯片间、设备间的连接载体全面升级,匹配12-18个月一次的算力阶跃式提升节奏;同时单芯片功耗持续攀升,电源系统从传统低功率分散式架构升级为更高电压、更高效率、更高功率密度的供电体系,液冷也从可选节能方案变为高功率AI集群的基础刚需配置,保障AI芯片的性能充分释放 【22】 【24】 。最后高速互连架构也将适配万卡集群需求,分阶段落地光互连方案,突破传统电互连的带宽、延迟瓶颈,重塑芯片内部的互连逻辑 【6】 。
基于调整后的硬件架构,GPU、TPU各核心硬件版块的元件需求量也将迎来结构性增长。GPU方面,预计GPU总出货量将增长30%,达到1640万台,高资本开支背景下,2030年GPU/加速器芯片出货量有望达4000万颗;CPU配对需求随架构升级迎来约4倍的结构性爆发,NVIDIA Vera超级芯片采用1个CPU搭配2个Rubin GPU(对应4个GPU晶圆)的配置,即使GPU数量保持不变,单节点核心需求10倍跃升与1:4部署折算,也会带动整体CPU算力需求快速提升 【29】 【32】 【37】 。存储相关需求中,CPX架构下GDDR7需求将呈现爆发增长,SOCAMM需求放大,LPDDR堆叠方案普及,引线键合用量提升;互连与结构件方面,CPX平台功耗达880W,需从风冷转向液冷,背板连接器用量提升以减少线缆使用,中间板面积、连接器数量同步增加,PCB层数从24层升级至26层,同时新增PCIE Gen6相关互连配置;ABF基板需求同样紧张,AI端ABF基板单芯片面积是消费PC端的8至12倍,即便AI GPU出货量仅占整体基板出货量的35%,也会消耗整体ABF产能的70%以上 【30】 【36】 。TPU方面,预计2027年谷歌将在博通平台上量600万台TPU相关产品,在联发科平台上量200万台;CPU与TPU的配比率将从当前的1:3提升至1:2,TPU v8系列首次将Axion CPU定位为独立“协调器”,承担工作负载调度、遥测数据收集、跨节点数据移动三项职责,新增的独立“协调芯片”层相关设计IP与封装需求将外溢至联发科、世芯电子与信骅科技等厂商 【29】 【30】 【37】 。存储配置上TPU单颗HBM规格处于较高水平,TPU v8t训练版搭载216GB HBM,HBM带宽达6528GB每秒;TPU v8i推理版搭载288GB HBM,HBM带宽达8601GB每秒;配套的2-die小芯片需求也持续上行,预计2027年对应的需求量将达到180万颗,后续还将进一步增长至220万颗 【29】 【30】 。
从成本维度看,不同代际GPU、TPU的核心元件采购价格与BOM结构也呈现出明显的代际特征。以B200 GPU为例,其核心元件成本中高带宽内存(HBM)为2900美元,是B200成本占比最高的元件,逻辑芯片制造为900美元,先进封装为1100美元,辅助组件为480美元,HBM是GPU类加速芯片的最大成本来源,且该趋势在2026年上半年还得到了进一步加强 【41】 。从AI服务器整机维度看,搭载H100/B200的高端AI服务器中,存储系统(HBM+DDR5+SSD)的BOM成本占比已经从传统通用服务器的约15%提升至30%-35%,其中HBM3/3e的每比特单价约为同容量DDR5的5-10倍,已经成为和GPU并驾齐驱的核心算力资产;不同场景的AI服务器成本结构差异明显,训练型AI服务器中GPU成本占比可达74%,HBM占比约7.6%;推理型AI服务器的GPU成本占比约38.8%,SSD成本占比则提升至27.7% 【44】 【45】 。从整机架维度对比,当前一代英伟达GPU机架的每吉瓦成本约为300亿美元,下一代韦拉·鲁宾GPU机架的每吉瓦成本将降至约250亿美元;而当前一代定制ASIC(含TPU类自研加速芯片)机架的每吉瓦成本仅为60亿至110亿美元,仅为同期英伟达GPU机架成本的1/3到1/2。从单位芯片TCO维度对比,TPU的资本成本占比普遍在72.7%左右,英伟达GB200/GB300的资本成本占比则达到77.4%-79%,侧面反映出GPU类芯片本身的硬件采购成本占总拥有成本的比重更高 【47】 【49】 。目前公开资料中暂未覆盖所有代际GPU、TPU的单颗芯片全元件采购价的完整拆解,上述内容为当前可获取的行业公开拆解核心参考。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803