这份研报主要围绕AI集群基础设施、芯片架构、网络、运营等方面展开,由国泰海通计算机团队与海外云和AI算力专家参与研讨。会议深入探讨了美国AI集群的供电、散热、网络架构限制,以及十万卡级集群的构成和数据中心经济合理单元。此外,还分析了AWS芯片组合、Serebras大硅片芯片的优缺点、HBM供需情况、英伟达与AMD芯片的竞争格局、十万卡级AI集群的市场需求和回报周期,以及中美AI集群建设的节奏差异等核心要点。
AI算力赛道未来发展趋势呈现多元化特点。从芯片架构看,英伟达仍占据主导地位,但亚马逊、谷歌等自研芯片性价比提升显著,未来可能冲击其地位。从集群规模看,十万卡级AI集群供不应求,GPU租赁和Token售卖模式展现出良好的投资回报。从地域布局看,国内AI集群建设节奏快于美国,东南亚市场潜力巨大。同时,大语言模型训练面临高质量数据瓶颈,企业级私有模型训练尚处起步阶段,数据成为关键制约因素。
研报重点分析了美国AI集群的硬件限制与挑战,包括供电、散热、网络架构对集群规模的影响,以及千卡级作为经济合理单元的考量。在芯片层面,深入剖析了AWS芯片组合构成、Serebras大硅片芯片的适用场景与局限性,以及英伟达、AMD芯片的技术对比和竞争态势。此外,还关注了HBM供需关系、大厂资本支出策略、十万卡级集群的市场需求和回报周期,以及中美AI集群建设的节奏差异等关键方向。
当前AI算力市场呈现供不应求的态势,十万卡级AI集群需求旺盛,GPU租赁和Token售卖模式的IRR超20%,回报期2.5-3年,Token类业务回收期更短。从芯片市场看,英伟达占据垄断地位,软件生态完善,硬件毛利率高;AMD作为候补选项,性能部分超越英伟达但软件生态薄弱;亚马逊、谷歌等自研芯片性价比显著提升,未来可能改变市场格局。HBM供需失衡但供应有保障,大厂通过资本支出应对涨价压力。
研报提示了美国建数据中心面临的多重风险,包括电力获取难度大、地电环保压力重,日本2兆瓦以上电力审批周期长达18个月,百万卡集群可能需自建电站或依赖氧化电池等自发电方案,公网供电几乎不可行。芯片层面,Serebras大硅片芯片存在内存小、软件生态弱、良品率低、生产成本高等局限性,不适用于推理阶段内存需求大的任务。此外,国内云厂商自研芯片面临先进制程生产的挑战,目前阿里已推进相关自研工作。大语言模型训练则面临高质量数据瓶颈,10万亿参数后提升空间有限,企业级私有模型训练尚处起步阶段。