您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:长江AI产业链深度巡演3网络架构谁更胜一筹 - 发现报告

长江AI产业链深度巡演3网络架构谁更胜一筹

2026-07-22 未知机构 极度近视
报告封面

00:00:00 Thanks for your participation, the meeting is ready to.本次电话会议仅服务于长江证券研究所白名单客户。未经长江证券事先书面许可,任何机构或个人不得以任何形式对外公布、复制、刊载、转载、转发、引用本次会议相关内容,否则,由此造成的一切后果及法律责任由该机构或个人承担,长江证券保留追究其法律责任的权利。 00:00:32 呃,尊敬的各位投资人大家晚上好啊,那么欢迎来到我们呃红宝书的这个深度巡演的这个第三期啊。深度巡演第三期,我们今天的话给大家重点聊一下网络架构啊。呃,那么网络架构这一块的话,由于涉及到呃比较多的这个专业知识啊,也欢迎就是大家嗯如果这个会后的话呢,也欢迎就是随时跟我们微信上再去做一些细节的沟通啊。那么我们今天的话主要还是把呃主流的几个网络架构,包括网络架构的一些演进吧,给大家大致过一下。呃那么首先的话呢就是我们的这个数据中心的内部的网络的设计。 00:01:13 我们从这个呃网络域的一些定义上来说的话呢,大家应该知道有几个呃比较典型的网络域定义啊,比如说我们的这个呃scale out的呃网络域,然后我们scale up的网络域,然后我们基于scale out可能还有一些拓展的我们叫呃scalecross的这种呃网络域啊。 00:01:34 呃那么其实网络本身的这个产生的目的的话呢,主要是去增强就是呃芯片之间的一个呃协同啊传输协同,嗯包括就是这个这个就是一些数据包的一些通信啊啊,比如你跟那个呃从GPU啊就是推理,比如说你到到终端用户的一些通信对吧。那么整个这些都是通过呃网络来实现,那么呃其中的话呢,有相当大一部分其实是停留在那个芯片协同这一部分。那么芯片协同的这个种类会非常多啊,包括你的GPU,GPU和GPU的协同对吧,呃我们CPU和CPU的协同,GPU和CPU的协同啊,GPU跟存储的协同。比如说SSD的呃这个这个服务器对吧,SSD的这个这个这个存储服务器啊,然后存储跟存储的协同对吧, 00:02:29 然后未来的话呢,可能有什么DRM跟DRM的协同,我们我们现在也在也在讲那个内存池化的这个技术,未来会去推广啊,会去推广那么。这个是整个网络发挥出来的作用,因为它本质上是一个润滑剂啊,去提升呃计算芯片去提升存储颗粒的一个这个发挥出来的一个性能啊。呃, 00:02:52 那么所以在现代数据中心里面的话呢,网络本身是重要的一环,尤其是我们现代的比如基于云计算架构啊,云计算这个理念去设计的数据中心,呃,网络是核心部分,因为云计算的底层逻辑是算力资源的这个虚拟化,我们叫磁化啊。那这个磁化的过程中的话呢,本身呢,我们的算力的这个服务器呢是是基于网络来实现,呃,这个就是从呃物理实体到一个虚拟实体的一个转变。然后呢实现就是可以随时地去调度这个算力啊,这个都是通过网络的方式去实现啊,高速网络方式去实现那么。所以呢, 00:03:33 在AI的爆发之前的话呢,我们的呃基于CPU的这个计算服务器集群,其实也在呃大规模地去使用网络啊,使用网络这个架构啊。那么嗯,那么到现在AI爆发之后的话,网络架构呢有有了一些嗯比较大的这种变化跟升级迭代吧啊,变化跟升级迭代,那么那么本身的话就是这个网络的这个产品呢,他们会有一个呃跟随,比如说计算产品啊或者跟随。那就是跟随比如GPU这种算力卡呀,或者跟随那个CPU是吧,跟CPU或者未来跟随存储啊,它本身有一个规格的一个提升。呃,那么这个我们今天就不会展开去讲了, 00:04:16 那么今天的话,主要是讲一些就是从网络的这个设计层面它看到的一些变化。 00:04:22 呃,那么现在的话呢,就首先我们讲一个这个定义的一个问题啊,就刚才我们讲了网络域的这个区分,我们的scale out网络域,我们的scale up网络域是吧,这这个是现在。嗯,最核心的这个这个这个数据中心的这个网络域的组成, 00:04:38 那首先第一个就要理清的概念就是scale up跟scale out是两张平行的网啊,两张平行的网,它们彼此之间是不重叠的啊因为过去的话呢,就是资本市场尤其是。喜欢拿那个什么柜内柜外啊去去定义那个sky scale,那这个是100%错的啊,100%错的。我们未来的话 呢,整个呃Skype网络是有大量的这个柜间柜外的一个形式啊,那我们的s scout网络呢,实际上也是有柜内的这种s scout网络的这个形式啊。那么所以呢,就是首先我们需要知道两张网它们是平行的,那么第二的话呢,我们来解释一下为什么要去设计这两张网啊。 00:05:15 那么Scale out网络首先的话呢就是呃,我们从使用的目的上来说的话,我们就是把它定义成一个泛用型的这个数据网啊,泛用型的一个网络域那那C网络里面跑的数据包。 00:05:30 呃,它的那个种类它的功能会非常的繁多啊,就是比如说我们有GPU跟GPU的一些这个这个协同是吧,也是有通过scaleout来实现的啊,然后呢,我们有GPU跟CPU的这个协同啊,我们有CPU跟CPU的协同啊,CPU跟CPU因为现在在我们的A g e n t、a g e n t ic、A I的这个整个发展过程中呢,呃,CPU在扮演一个越来越重要的一个角色啊,就他们整个呃数据呃整个的一个芯片用量会会大幅提升。那么我们所形成的这种专门的CPU的这个机架,呃他们之间的一个通信协同去调度任务啊啊,任务分配调度任务这个过程他们也是通过scaleout网络来实现啊, 00:06:14 SKY网络来实现走我们的一般以太网交换机那么。那么除了呃这些的话,还有比如说呃刚刚我们说到嗯GPU跟存储他们可以去通信,因为现在有storage tra有那种SSD的服务器放在呃靠近GPU边缘的位置。那随着我们推理任务的一个增加的话呢,未来会有更多的温数据会存会存在这个SSD的这个服务器这边。那么这个过程中的话呢,他们会走那个,比如说像英伟达架构里面,他们会有BF4的这种呃dpu的这个这个这个卡啊, 00:06:49 他们会通过这个spectrum交换机,也是通过以太网交换机去做做一个这个数据的交换啊,会直接会从这个。和GPU连接到那个呃就是交换机switch,然后再连接到我们的这个SSD的这个服务器啊。呃, 00:07:05 那么再有的话,包括我们现在呃这个推理的推理的这个过程,我们输出结果啊,我们output结果到用户到C端B端的这个用户,这个种这种南北向的流量也都是通过scout网 络去去传输的啊,去传输的那么。所以scout承担了整个数据中心的呃,基本上所有泛用型的一个数据包数据数据传输的一个功能啊。 00:07:31 所以这里我们定义的话呢,其实scout网络其实是相对比较标准化的啊,就是我们从呃这几代看到的这个scout网络设计呢,其实总体来说大同小异啊。 00:07:41 但是未来的话也会有一些呃这种这种细节的一些变化吧, 00:07:46 就是咱们现在也在拓展拓展我们的以太网协议啊,拓展我们的这种这种这柔K以太网,我们现在叫融合以太网的这种协议也在做一些改变啊。但是总体来说呢,我们各家这个厂商的嗯scales网络我们可以用大同小异来形容啊。基本上现在AI的数据中心呢普遍都是无收敛的,这个scout网络有的是做三层,有的是做两层啊,基本上就是这样的一个区别。 00:08:12 那么另外一另外一张网就是可能要重点介绍的是Skype网络。 00:08:18 啊Skype网络非常的特殊,呃,它跟我们现在讲的这个什么超节点这些都是呃高度相关的。呃,那么Skype网络的话呢,它从定义上来说呢,它主要去实现一个功能,就是算力卡的一个协同啊,算力卡的一个协同。 00:08:35 呃那么所以的话呢,我们在呃Skype网络的设计就是初初始的时候呢,其实做的是比较简单的,嗯最开始大家有可能还记得啊,就是23年出来的巴卡服务器,巴卡服务器里面我们有就是8张卡去做Skype通信的这种方式。我们在一台呃巴卡服务器内部,我们在PCB板上面我们是放上那个NVS switch,比如以英伟达为例啊,放上nv switch的这个这个芯片,然后放8张那个比如a100的卡。当时是a100的卡,然后我们可以基于那个nvswitch芯片去做一个小的Skype,Skype网络域的一个交换。那那个时候的话,整个网络域的规模特别的小,只有8张卡啊。那后续的话,为了进一步去增强呃卡和卡的协同性能, 00:09:23 英伟达引入了这种呃rack方案啊。就现在我们国内喜欢叫单柜超节点吧,那实际上海外就是叫RA方案对吧,叫rack方案。那么就是英伟达开创了这个RA方案的时代,然后我们就我们把这个呃Skype的这个网络域拓展到了一个柜子的大小,那在在这个柜子内部的话呢,我们会看到就是呃很多的这个compute tray,很多的switch tray,然后comp computeretray也会跟switch tray去连接。那Switchtray内部呢会放我们的nvswitch芯片,就我们叫scaleup,我们叫scaleup交换芯片啊,然后呢,去实现一个这种单柜的这种更大范围的Skype连接啊,单柜规模上英伟达能做到72是吧,谷歌那边是64是吧,然后各家的这个数字也都不太一样。 00:10:11 啊,那么其实现在国内也在规模地在去推这种,他们叫他们国内喜欢叫单柜超节点的这种这种方案啊。那么这个其实当然英伟达他们在24年就提出来嘛,25年其实我们就规模地在用这个东西了啊。然后呃再到现在的话呢,我们会呃进入到一个新的时代啊,进入到一个新的时代的话呢,我们会到这种跨柜的这种超节点啊,我们会出现跨柜子的这个Skype。那跨柜子Skype它本身诞生的这个初衷的话呢,其实也比较简单,就是我们想进一步去提升呃Skype网络域啊,进一步去提升这个这个这个卡间协同的一个性能释放是吧,所以的话呢,我们开始呃开创性地去推出。 00:10:54 柜间的Skype的通信,我们组成一个更大的这种超节点啊,更大的这种超写点。那么这里的话有几个典型的这个代表作吧,典型的代表作包括谷歌的这个ironwood的superpo,ironwood super po的话呢是实现了嗯。I有的是实现了呃,我们144个啊,64卡机柜的一个互联啊,然后最终实现到9216张卡。啊,然后这种大规模的Skype集群,然后呢,嗯,那么后面当然就还有像英伟达的这个Rubin ultra576啊,rub宾ultra576的话呢,就是他们也是就采用了啊,采用了这种大规模的一个呃Skype的一个设计。啊,然后再到比如说华为的最开始384超节点嘛,那么现在他们可能呃,950的这一款芯片又上了一个8000多卡的超级点啊, 00:11:52 那么就是从从海外到国内吧,啊,从海外到国内就陆续开始推出这种大规模跨。嗯,跨节点呃就是跨机柜的这种超节点设计,那这个过程中的话呢,就会呃额外的产生比较多的这 个跨机柜的Skype光通信啊,跨机柜的Skype光通信。 00:12:13所以这部分呃算是就是我们进入到可能现在今年是26年吧,26年开始吧,到27年规模的普及啊,更大规模的这个Skype超节点就会去啊去商用啊。 00:12:26 那么这个这个整个所以整个就是网络架构的一个发展过程, 00:12:31 大家可以看到它的核心变化是什么呢?就是。我们在依赖网络去提升集群的性能啊,也就是说我们堆更多的网络,比如说我们堆堆更多的这个Skype域,把这个Skype域堆堆的规模更大。或者是scout的这边我们可以呃去想一些办法,可以把那个集群的规模扩大啊。 00:12:54 那整个这个过程的话,最终达到的一个效果是什么呢?是去提升呃在这个集群内部的这些,比如说算力卡的一个呃使用性能的释放啊。当然未来的话,刚才我们也说了,可能不只是针对算力卡,我们未来会针对存储啊,我们会针对存储去做比较大的一个这个就是池化啊,先是池化,然后最终达到一个提效的一个这样的一个效果。 00:13