2026年08月18日19:50 关键词 超点服务器 国产芯片 推理 训练GPU液冷 算力 集群 超算AI模型 架构 散热 成本 性能 部署 网络 网络互联交换芯片CPU 全文摘要 本次会议强调了会议内容不得复制或传播的法律重要性,并介绍了发言人关于超算技术与AI未来发展方向的讨论,重点关注了国产算力、芯片扩产对资本开支的影响,以及国产芯片供给增加对AI能力的预期。深入探讨了超算服务器(超点)的需求增长,特别是训练和推理方面的需求,强调了技术架构、网络通信技术(如交换芯片、互联架构、液冷和供电技术)的重要性,以及这些技术对超点服务器性能和成本的影响讨论还涵盖了服务器和相关技术厂商的机会,特别是在国产替代窗口期可能迎来的市场机遇。最后,发言人鼓励投资者关注该领域的持续发展,并表示团队随时准备提供进一步信息和支持。 章节速览 l00:00超点服务器与国产AI芯片的未来趋势 对话讨论了国产算力的激增和国产芯片供给缓解对资本开支的影响,强调国产模型性能提升将加速推理需求释放。超点服务器作为降本增效工具,其需求预计今明两年大幅增长,建议关注该板块。未来训练与推理方向将成为重点。 l04:16超点服务器在模型训练与推理中的优势 对话讨论了超点服务器在模型训练和推理方面的显著优势。在训练方面,随着模型参数的增加,超点服务器通过加速GPU间的参数交换和数据同步,缩短了大模型训练周期,提高了训练效率。在推理方面,超点服务器通过多卡互联和显存池化,降低了QV cache的负载压力,提升了推理成本的性价比,特别适合处理百万级上下文的推理任务。国内外云厂已广泛采用超点服务器,以加速模型迭代,保持技术领先。 l08:10超算集群与超点技术:未来算力的发展方向 对话讨论了未来10万卡至百万卡超算集群的构建策略,强调通过提升服务器规模与优化网络架构降低复杂度与运维成本,提升算力效率。提出了超点概念,即通过高带宽互联协议将GPU统一为逻辑上的大GPU,以解决通信、内存与功耗问题,实现性能与成本的优化。超点技术相比传统集群,展现出更强的性能与更低的推理成本,成为未来算力发展的关键。 l11:08超跌点技术在算力基础设施中的应用与市场分析 对话讨论了超跌点技术在算力基础设施中的三种主要形态:整机柜超跌点、节点超跌点(或matrix超点)及小型超跌点,强调了其在AI推理与训练领域的应用。指出未来算力基础设施将朝着节点超跌点形态发展,形成级联集群部署。同时,分析了不同规模企业对超跌点技术的需求,尤其是中小企业的市场解决方案,以及互联网厂商、运营商和政企市场在这一领域的参与情况。 l15:08超点服务器架构解析:正交与传统对比 讨论了超点服务器的典型配置,包括顶部的QR交换机、5.5千瓦PSU、计算节点与GPU布局,以及正交架构与传统架构的优劣。正交架构通过将交换机置于机柜背部,实现90度垂直连接,增加单柜GPU数量,简化布线,但灵活性较低,适合特定客户需求。 l17:39超点服务器与普通发卡机的架构对比及网络通信环节利好 对话详细对比了超点服务器与普通发卡机的整体架构,指出超点服务器的核心优势在于新增的网络通信环节,特别是交换芯片和互联需求。讨论了国内外典型配置,强调了国产交换芯片在当前元器件紧缺背景下的替代机遇,以及未来随着超点需求增加,对交换芯片需求的拉动作用。 l20:30交换芯片在网络架构升级中的关键作用 讨论了交换芯片在高性能计算网络架构中的重要性,从早期无需交换芯片的简单互联到当前及未来复杂架构中交换芯片的必要性。随着单通道速率提升和通道数量增多,交换芯片的需求显著增加,尤其是在GPU互联带宽和显存带宽扩大的背景下。预测未来网络互联将经历从0到1的拐点,带来一波需求增长,特别是在两层网络、胖树架构及背靠背网络中,交换芯片的需求量将进一步提升。 l25:16超大规模计算集群架构与互连协议的演进 讨论了加工工fly、forfollowformath网络等架构在超大规模计算集群中的应用,强调了架构细分与giveup协议成熟对超点服务器放量的重要性。提到了NAlink、UAD、ETH杠X等协议的完善与开放,以及自研 scalep协议在软硬件成熟度上的进展,共同推动了大规模计算集群的商业化加速。 l29:02超算时代服务器厂商价值重组与毛利率提升 对话讨论了超算时代服务器厂商面临的挑战与机遇,指出随着技术门槛的提高,行业集中度增加,头部厂商通过提升参与环节的价值量,有望迎来毛利率的显著改善。建议关注国产替代厂商及服务器环节,认为服务器盈利能力将逐步提升,形成新的增长点。 l32:27超点框架培训:网络互联与升级趋势解析 本次培训重点讨论了超点框架下网络互联的关键环节与升级趋势,包括sweettree与freetree之间的连接器、铜缆,以及NPO、LPU光解决方案。特别提及了圣诞股份、一华、华丰等厂商的潜力增长。核心增量在于网络交换芯片、交换机网络互联,以及整机厂服务器和液冷技术的升级,供电标准从3.5至5.5伏升级至240至800伏。整体框架从上至下依次关注板块,强调IDC环节的重要性,鼓励后续交流与联系。 要点回顾 为什么我们看好超点服务器在国内市场的放量? 我们看好超点服务器放量的原因主要有三点。首先,当前国产算力的叙事逻辑正从自动开支转向实际采购像字节跳动和Q2批复的公司明年的资本开支非常激进。其次,随着国产芯片上游封装厂和晶圆厂扩产,国产芯片出货量明年相比今年将大幅增长,初步缓解芯片供给紧张状况,导致大厂在国内的资本开支倾斜比例持续加重。最后,国产模型性能通过迭代提升,参数量不断增加,并有望随着逐步开源带动国内AI能力整体提升,从而加速推理侧需求释放。 超点服务器相较于巴卡机在推理方面的优势是什么? 超点服务器相较于巴卡机,在推理方面表现出显著的降本增效优势。其单token每秒钟每瓦的吞吐率远高于巴卡机,且整体来看,今明两年对超一点服务器的需求将大幅增加,尤其在大型企业如字节的大宇、阿里的磐久等已开始采用超点服务器进行云上出租和集群部署。 为什么训练也会用到超点服务器,它在训练场景下有哪些优势? 在训练场景中,超点服务器的应用主要体现在两个方面。一方面,随着模型参数增加,超点服务器能解决单卡或单个八卡服务器容量限制的问题,通过扩大服务器规模进行训练性价比更高。另一方面,当前主流的MOE架构模型训练过程中会产生大量专家间通信流量,超点服务器内部通信设计能够有效减少跨GPU 的无序流量,加速GPU之间的参数交换和数据同步,缩短大模型训练周期。 为什么推理侧急需采购超点服务器? 国内急需采购超点服务器的核心原因是其卓越的推理性能和成本性价比。相较于巴卡机,超点服务器凭借多卡互联、显存池化以及QV cash快速卸载等技术,能够提供更高的TPS(每秒交易数量),更适合处理百万上百万上下文的推理任务,减轻KPK负载压力,并且整体推理成本更低,是使用国产卡构建高效推理环境的更优选择。 如何实现未来的佰万卡集群?超级点(SuperPoint)是什么,以及它相较于普通集群的优势是什么? 要实现佰万卡集群,首先需要通过提升服务器技能(scaleup),将服务器规模扩大至64772128甚至256的级别,然后再进行网络架构的优化(scaleout)。这样做的好处包括降低集群网络架构复杂度和运维成本,同时提高超级集群的通信速率,减少算力损失,从而节约成本。对于云厂商而言,这也是一种高效的方式超级点是一种通过高带宽互联协议将多个GPU互联组成统一编制、低延迟的逻辑大GPU的架构。相比普通集群,超级点性能更强,推理成本更低。目前,超级点主要有三种类型,如整机柜超点、节点超点和matrix超点,它们能够提供更灵活的部署方案,并适应不同规模和需求的企业使用,包括中小企业对AI推理和训练的需求。 大集群技术解决的关键问题有哪些? 大集群技术主要解决了三个方面的问题:一是通过高带宽互联协议HBD域来解决通信速率低的问题;二是通过统一语义内存的芯片设计解决内存强的问题;三是通过集中供电、高电压DC以及液冷散热技术来解决工程上落地的功耗墙问题。 超点服务器的具体组成部分及其设计特点是什么? 超点服务器通常由顶部的QR交换机、底部的5.5千瓦PSU、中间配置的计算服务器(如放置4到8个GPU)以及相应的交换节点组成。此外,还有主备PSU、柜内液冷CDU等配套设施。其中,正交架构的超点如华为的9501024差异点,采用了垂直90度连接设计,将交换券空间省出并放在机柜背部,这样可以增加计算单元的数量,但同时也意味着整体架构相对固定,不如普通方案灵活。具体采用哪种方案取决于终端客户的需求。 超点服务器与普通服务器在硬件配置上有哪些主要区别?目前超点服务器常见的互联架构有哪些特点?超点服务器相较于普通服务器,主要多了Scp通信网络这一部分。这个网络由交换芯片(如以太网或特定 总线协议的交换芯片)以及用于放置这些交换芯片的散热模块构成,其核心在于提供计算节点间的高效互联。目前比较典型的超点服务器架构包括上创架构或两层chassis架构,两者均采用无收敛的一对一互联方式,GPU互联带宽乘以数量超过交换机互联带宽乘以数量。随着GPU数量增加和link速率翻倍,对交换芯片的需求也会相应增加。 国产超点服务器在互联网络架构上的发展趋势如何? 国产超点服务器会经历类似的过程,通过增大HBDE(HighBandwidthDirectExternalMemory)来减少HBM降配问题,增加更多卡进行互联以增大显存带宽,从而提升对交换芯片的需求量。随着行业向256卡互联、甚至512卡互联方向发展,网络互联环节的需求将持续增长,不仅有第一波放量机会,后续扩展时也会出现较大斜率的需求增长。 国内超点服务器的典型配置是什么样的? 国内超点服务器的典型配置是以8颗GPU为核心,配有一个交换器,并可能包含tree结构,其中tree内可容纳2到4颗GPU或交换芯片。此外,还有更豪华的4D配置,例如将4KGPU配置到一颗交换器中。 超点服务器网络通信环节中,国产交换芯片有何机遇?超点服务器中交换芯片的角色及其发展历程是怎样的? 国产交换芯片在超点服务器放量过程中扮演重要角色,主要是由于海外先进芯片供货短缺以及元器件紧缺带来的国产替代窗口期。随着国产自研交换芯片的推出,未来随着超越需求的增长,将对国产交换芯片产生拉动效应。早期超点服务器无需交换芯片,通过cubematch或全部match互联。随着单通道速率提升和通道数量增多,为了简化设计并应对复杂性,新一代产品如A100、A800、H100、H800、H200等引入了板载的NVswitch芯片。最新的72卡机柜设计中,将交换芯片独立出来部署在新思维区。 在for follow for math网络中,华为从384到950柜面的架构是如何设计的? 华为的架构采用的是混合架构,主要以formats加close架构为主。在扩展维度时,由于formats成本较高,close架构因其易于落地而被优先采用。整体架构上,它采用了细分的双面式或柜内八个板载二级方面的设计,并通过光互联实现单个集群1024卡的全互联,甚至可以扩展到8个1024卡的全互联。 早期为什么朝鲜方案主要是由NV推动的? 早期朝鲜方案主要由NV推动是因为其NAlink协议非常完善且成熟,不仅用于GPU之间的互联,还涵盖了CPU和GPU之间的互联以及其他一些协议,如LPUI等。国内如海关、华为等企业也有对应的私有协议, 并且随着自研scalep协议在软件和硬件上的逐步成熟和落地,行业出现了从0到1的加速拐点。 除了网络互联方案外,在服务器内部还有哪些关键环节值得关注? 服务器内部的重要环节包括使用PCAswitch扩展PCI通道,以及随着PCI协议的发展,实现更多通道数量的互联。虽然P加E速率较低,目前仍是一个可选方案,但主流仍以太网为主。未来对于存储服务器,对CPU引用C上游协议互联的需求也会增加,同