一、AI总结内容 一、核心要点 1. 本次会议汇报为长江证券研究所AI成熟系列第二篇,围绕“Token工厂”从堆资源向榨资源的产业升级展开,属于算力租赁行业的深度思考,是行业内正在发生的产业升级变化。 2. Token工厂核心定义:2024年由黄仁勋提出,是以高效生产Token为核心产出指标的新一代AI基础设施,收入取决于Token吞吐量与平均定价,核心竞争从硬件堆砌转向资源利用效率提升。 3. 产业阶段变化:AI行业从2022-2023年的硬件资源竞争,升级为当前的效率竞争阶段,行业北极星指标从GPU保有量转向Token吞吐量。 4. Token吞吐量的核心影响因素:AI系统软件站(调度平台、心模协同),而非单纯硬件数量,调度平台方面,GPU时代的调度复杂度远高于传统CPU云,行业普遍存在MFU(模型利用率)低的问题,如科威尔MFU约50%(行业平均约40%),阿里云按Token级调度可提升吞吐1.5-9倍。 5. Token定价的分层逻辑:Token分为基础设施、专家级、前沿级三层,定价分别受推理成本、能力溢价、竞争策略影响,底层基础设施Token存在通缩,优质模型溢价更明显,行业已形成分层市场。 二、国内商业模式分类 1. 类聚合平台模式:类似OpenAI,提供全场景Token服务,参与者为AIDC、云计算厂商,比拼调度能力与规模效应。 2. 垂类行业Token模式:依托行业Know-How打造专属模型,推理毛利可达45%以上,服务企业级需求,获取能力溢价。 3. 透明分成模式:算力租赁公司与大模型公司合作,共享前沿级Token收入,绑定高利润的顶尖需求。 三、风险与关注 1. AI系统软件站的研发进度可能影响Token效率提升幅度,调度与心模协同技术存在迭代不确定性。 2. Token分层市场的竞争可能加剧,不同层级玩家的定价策略或影响行业利润水平。 3. 算力资源获取成本的变化可能影响各类商业模式的盈利空间。 二、音频原文(转写) 本次电话会议仅服务于长江证券研究所白名单客户,未经长江证券事先书面许可,任何机构或个人不得以任何形式对外公布、复制、刊载、转载、转发、引用本次会议相关内容,否则由此造成的一切后果及法律责任由该机构或个人承担。长江证券保留追究其法律责任的权利。各位领导,大家晚上好,欢迎接入我们今天的这个长安计算机的一个汇报。那今天汇报的是我们整个AI成熟系列的第二篇,通用工厂从非资源到大资源的产业趋势。 那这个报告呢,其实之前也跟很多领导在汇报的时候是引用过这个内容的,它其实本质上是我们对算力租赁这 个行业的一个更深一个层次的一个思考,也确实是行业里面现在正发生的一些产业升级的具体的一些变化。那今天的话呢,也是呃应该是第一次,就是跟大家完整的去把这个深度报告去讲一下。是 啊,那是这样子,就是呃,我们先讲一下整个报告的一个摘要。其实为什么会讲通用工厂这个事情,其实也是因为我们紧密的去跟踪海外的一些产业的一个变化,就算中心的这样的一个变化。 简单来说,什么是通用工厂?它其实。呃,就是以高效生产token为核心产出指标的新一代AI基础设施。这个概念其实呃2024年大概是由黄仁勋去提出来。 呃,这个概念的。它的本意就是说,呃,要把这个。嗯,TOKEN吞吐量啊为核心去衡量所有的新一代的这个AI基础设施。而不仅仅是说去堆砌一些像C P U算力、C P U算力。 HBM等等的这样一些裸金属。而是要把电力、GPU、网络和模型高效转化为持续输出的一个TOKEN流。啊,并且这个TOKEN流最后要转化成为我们所谓的这个智能服务和收入。那就比方说像 mass 输入等等啊,就这样的一些形式。 那我们刚讲这个东西,它其实是2024年由黄仁勋所提出的那。他其实 嗯,提出这件事情的本质就是。要让大家明白,其实在这个AI时代里面。呃,算力的堆砌,硬件的堆砌,它背后的背背后的核心的这个目标都是为了去转化token。 然后TOKEN再去售卖成这个服务。所以token的吞吐量,它其实直接决定了一个所谓AI TOKEN工厂,或者说所有的这种硬件设施。他未来增寿的一个能力和资本的一个回报率。那如何去高效榨取有限的一个资源,其实是 呃,我们说AI基础设施最核心的一个竞争的一个抓手。 那其实他提出这样的一个概念,就是希望大家能够把。呃,关注的一个重点,从单纯的一个硬件的堆砌转向后续的这个TOKEN生成上去。那竞争逻辑可能也从单纯的拥有多少硬件转向成了如何让。现有的硬件去生产出更多的一个token。 那我们刚讲,其实通用工厂它本质上就是一个token吞吐量。乘以。嗯,平均的TOKEN定价。这样的一个模式,它的收入其实最主要也是由这两件事情去决定的。 那么我们本篇报告,本篇报告会会分开来去探讨量和价值两件事情。从量的角度来看,我们会发现AI的一个系统软件站决定了通用工厂的一个资源转化效率。那在AI的这个时代里面,其实 呃,真正决定我们现在所既定的既有的一些算力资源能够释放多少价值的。它不仅仅是说硬件的数量。 那其实你比方说一万张卡可能在英伟达的手里,和在其他的这些普通的。生产中心手里,他最后能够生产出的TOKEN可能是截然不同的。呃,数量甚至有可能是跨量级的这样的一个数量。它背后是因为软件站的能力截然不同。 呃,调度平台呀、推理引擎啊、编译器模型优化,包括信模协同等等的一系列的这个AI系统软件站。正在发挥越来越重要的一个作用。而且相比于传统时代,其实这些调度平台也都很重要。但是与传统时代相比,可能在呃G P U时代,或者说A I时代。 这些软硬件协同软件栈的这个重要。性其实是在持续的。去提升。所以这个是我们认为量的一个点。 那如何去提升这个token的一个吞吐量?其实是个非常复杂的一个事情,我们说它是一个多因子的一个纠缠模型。呃,它其实有很多种手段可以去提升。那我们本篇报告主要就聚焦了两个,一个是调动平台为核心。 第二是心梦血统为核心。啊,这里面列举了一些这个论文相关的一些实际的这个研究成果和数据。大家感兴趣的话,也可以去后面看一下这个。完整的这个报告。 那第二个呢,就是价格。也就是说,你这个通用故障的收入,它除了这个通用通用图像之外的话,就是如何去从价格的角度去分析这个收入如何如何被最大化。那TOKEN的定价,它其实是 也是一个多因子纠缠模型。TOKEN的定价本质上是由推理成本、能力溢价,这个能力指的就是模型的能力溢价。 和嗯在同一个 能力阶层的模型的这种竞争策略去共同决定的。TOKEN的定价本质上是由 うん。非常多的因素决定。但是呢,不同层级的这个TOKEN的主导因素显著存在差异。 这个也是我们之前一直跟大家强调的,就token的这个市场其实正在出现一个很明确的一个分层。不同层级的这个TOKEN,它的定价因素可能最后追溯下来都是这三件事情。但是每一个因子的影响程度是截然不同的。如果说我们把token 呃,分成三个层级,最层最底层的是这个基础设施token,也是我们用的最多的。 啊,这样的一层。另外的话呢,就是呃这个我们叫专家投肯,或者有些叫做企业级投肯。然后最前沿的可能叫做这个就是frontier,就是最前沿的这些token。那对于这三种不同层级的token。 大家所看到的,大家所 嗯,发现最后可能决定你定价的东西。是截然不同的啊。所以这个是我们接下去可能会从这个通过分子的一个角度上面去探讨,就TOKEN的这个定价。是不同的。 那所以以上两件事情,一个是量,一个是价。他可能就呃共同决定了一个通用工厂。或者说一个AI factory。他如何去获得收入最大化,啊,如何去找到这个。 呃,这个这个这个这个这个全局最优解吧的的这个最基本的两个因素的一个逻辑。那最后看的话呢,就是我们简单分析一下现在在偷工工厂这个大背景之下,国内延伸出的几种商业模式。我们刚刚讲。从工厂这个概念,其实是老黄提出的。 但是黄仁勋当时在提出这个概念的时候,其实他 呃,讲的是比较直白的,或者说他是一个比较单纯的从AIDC的这个资源最大化的这个角度去的,就是他其实没有怎么考虑价格的问题,他考虑的更多是量的问题。就是我现在手里面的这些token,还有这些硬件。我如何去释放出我更多的这个。え。 这个这个这个性能。呃,但是进入到了国内之后呢,其实我们现在可能逐渐演变成了三种不同的这个商业模式。第一种呢,就是我们讲的。呃,以老黄这种发言,他的立场为核心的,有点像AI聚合平台的这种商业模式。 然后另外的话呢,就是这个垂类的行业头肯。就是不同的一些行业的这种模型,它可能自己不是硬件持有方,它也不是云计算行业。他更他也不是A I D C,不像是英伟达这样的一个角色。它更多的它就是呃可能像有点像偏软的一些应用公司。 他的核心能力不在于模型,而在于他。在某一个行业里面沉淀了很多年。所以他拥有这个行业的这个弄号。那这样的话呢,他就可以。 呃,通过自对自己行业的这种数据的一个把握。让他自己的这个模型可能通过一些后训练的这个方式。获得更多的 就是行业里的一个弄好,让他能够在特定的行业里面表现出。远高于可能通用大模型的这种性能和准确度。 那这样的公司,它的推理毛利可能就会很高。可能你比方说传统的这些通用大模型,它的推流毛利如果在二十到三十的话,那么这些公司有可能就能够到个。四十五岁甚至更高一点的这个水平,这是第二种。第三种形态呢,就是我们讲。 可能一些算力租赁公司和模型公司,现在逐渐开始落地的这个透明分成的一些模式。它也可以被称作投影工厂。所以呢,其实我们现在在讲客户工厂的时候,起码在国内的语境下会有这三种不同的商业模式。所以可能最后跟大家去分享一下这部分商业模式的一些细节。 好,那稍微花了点这个时间去跟大家讲这份报告大概在讲什么内容啊。首先就一个是概念,一个是定性。另外呢,就是从这个量和价的这两个角度去看,呃,我们怎么去分析这个特工工厂的收入,它到底怎么样去maximizing啊?怎么去maximizing? 因为我们为什么不分析成本,就是因为我们其实在讲的时候,我们带了一个非常重要的一个假设,就是我们其实在讨论在同样的这个成同样的这个卡的这个数量之上,我们怎么样去通过价和量的这种战略选择,然后去成成为一个这个。呃,这个这个收入最大化,那你成本是既定,其实本质上就是利润最大化嘛。啊,当然里面可能会有一些电费的这样的一些影响。那最后的话可能就是跟大家去讲一下现在不同的这个商业模式。 好,首先第一阶第一,我们先快速过一下痛工厂是什么东西,因为刚刚其实我也基本上把这个概念性的一些东西跟大家汇报过了。痛工厂的一个出现,其实本质上是标志着这层产业正从资源竞争进入到效率竞争的阶段。呃,我觉得这句话是我其实没报告想要去表达的一个核心。就其实在通用工厂这个概念提出来之前,2022年、2023年左右的这个时间。 大家的目光基本上。不管是二级、一级,还是行业里的人,可能大家的目光就是集中在。我怎么样去抢夺,去堆砌更多的这个硬件?无非是硬件从。 C P U变成了H B M,肯定后面又会变成C P U。所以它其实是一个。就是非常呃,但它本质上其实都还是对于硬件是一个,就是只你只关心这些硬件的一个堆砌。但你后来会发现一个很有意思的事情。 就是您可能有个。一千张卡的时候和一两千张卡的时候,你发现的偷粪吞吐。是可能是两倍左右,两倍的一个 一个差距。但是当你有了四千张卡的时候,你会发现可能你的这个拖后吞吐的一个系数就下来了。 呃,这个背后是什么呢?就是因为,呃,如果你只去堆砌这个硬件的话。那么现在的这个呃AI时代的任务其实非常复杂的。那么你如果不做任何的这种软件站的优化和调度的话,那么基本上。 你这个卡它越到后面能够发挥的这个效能,单位的效能就是越低的。所以其实这也是为什么我们现在去讲通用工厂,就是我们会发现。你只去考核CPU、GPU、HBM等等硬件的一个数量。它背后其实并不横线等于。 这个。这个这个最后的生产力,它可能是个约等于的概念,但它可能就不直接等于了。而且随着量越来越大,你会发现你所谓的这个消耗和浪费资源的浪费会