——AI行业深度研究报告 研究团队:传媒互联网组、海外组报告日期:2026年8月1日 摘要 ➢围绕Token经济的讨论本质是为AI的远期需求定价。token来自“大模型处理信息的最小信息单元”这一技术定义,黄仁勋自2024年以来围绕其逐步构建起“token工厂”和“token经济”的叙事。“token经济”本质是凭借token在AI创造价值产业链中间环节的地位,将其作为AI产业的景气度指标,token的规模并不等同于当前AI创造价值的规模,但代表了社会对AI远期需求的期望。 ➢Coding之后,如何预期AI需求趋势:市场对“token经济”的争议本质还是对AI需求预期的波动。1)头部公司token投入策略的调整,并不代表AI产业逻辑的破灭,而是代表“token经济”正尝试从“算力-token”向“token-价值”阶段切换,token消耗领先于token创造的价值,也是其属性带来的正常规律,B端效率提升会从代码扩散到研发费用、行政费用等方面,对应全球约2万亿美元市场空间,C端还会随着能力提升持续增长,后续需求空间仍有较大拓展空间;2)AI效率提升会降低同一任务的token消耗,但AI仍然在追求效益最大化的阶段,随着能力的提升,整体token的需求和消耗反而会增加;3)各产品token定价本身存在起伏,并非只有api提价才是积极信号,价格变动体现的是产品不同的定位和竞争策略;4)算力供给不足的情况可能在一段时间内持续,由于模型迭代、上下文长度、场景拓展,需求呈乘数的增长,而供给是累加式的推进,增速呈现阶段性错配。 ➢Token经济催化:模型迭代、推理优化、交互范式、物理AI。1)模型能力提升是AI需求和“Token经济”发展的本质动力,开源模型参数量竞争仍在继续,RSI有望催化模型加速进步,关注核心测试基准的得分情况变化;2)推理效率的改进,诸如kvcache优化、量化等技术的应用与发展,改变的是“算力-token”阶段的效率;3)用户与AI的交互范式持续变化,往往伴随AI主动权和token消耗的增加,有望拉动新一波token消耗;4)物理AI的潜在应用空间和算力消耗都体量庞大,其发展将成为AI需求进一步打开的重要催化。 ➢Token经济产业链投资机会。1)AI大模型行业领先选手可将竞争力变现;2)具备强议价权的核心硬件供应商将受益于下游需求扩张;3)Token经济带动token工厂、中转站等AI基础设施新业态机会;4)关注专业语料推理变现与具备稀缺性的物理AI数据积累;5)AI应用中,AI大模型公司有望沿着coding向办公拓展,而目前可用性较高、同时具备行业壁垒的方向有望取得突破,如视频、营销、电商、金融法律等。 ➢风险提示:大模型能力迭代不及预期;算力短期供需波动;AI应用推进不及预期。 Token经济本质:AI的远期需求定价 Coding之后,如何预期AI需求趋势 Token经济催化:模型迭代、推理优化、交互范式、物理AI Token经济产业链投资机会 风险提示 01 Token经济本质:AI的远期需求定价 1.1 token:AI景气度指标,AI供需关系的体现 •Token(词元)是大模型处理信息的最小信息单元。如在大语言模型处理过程中,文本内容会先被拆分为不同的token,如输入内容会被拆为输入tokens再进入模型处理,形成输出tokens,再转换为回复内容。不同文本场景下,同一个单词也可能对应不同的token。 •当前大模型产品中常常采用token作为计费单位。大模型产品往往采用token输入或输出的数量计费,此时接近于“千瓦时”或“byte”之类的计量单位,根据OpenAI,一般4个字母或3/4个单词对应一个token,1段话约为100个token,deepseek指出1个英文字符约为0.3个token,1个中文字符约为0.6个token;根据AI运行的不同环节,token包括输入、输出、缓存、推理四种类型,一次AI交互所消耗的token数量来自各项的合计,用户使用大模型产品的付费依据就是输入/输出token的数量再乘以单价。 1.1 token:AI景气度指标,AI供需关系的体现 •Token消耗量随着AI普及而迅速提升。中国日均词元调用量在过去两年快速增长,2026年3月已经达到140万亿。 •Token数量的增长不等于当前AI创造价值的增长,但代表了社会对AI远期需求的期望。同样的Token消耗,在不同使用场景所能带来的价值不同,token经济不等于终端价值,但token消耗的增加直接带来大模型实际收入增加,体现的使用者的付费和投入意愿,因此我们倾向于将token的消耗理解为社会对AI远期需求的期望,AI远期理论价值空间决定了token经济的兴衰。 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢1)数据中心变成token工厂:不再是存储和处理数据,而是输出token •在GTC 2024大会上,黄仁勋开始提出“AI工厂”(AI factory)。黄仁勋总结到,2023年兴起的生成式AI带来了“新的工业革命”,而“AI工厂”输入数据和电力,产出token,可以对比电力革命中生产电力的发电厂。 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢1)数据中心变成token工厂:不再是存储和处理数据,而是输出token •2025年3月加州GTC,黄仁勋进一步完善了单个token工厂的模型,指出一个工厂要兼顾用户体验(单用户每秒响应的token数)和收入最大化(整个工厂每秒生产的token数),而两项要求之间存在矛盾性,有限的算力能力下的二者组合连起来形成了限制曲线,优秀的“工厂”要选择最合适的二者组合,若要扩展这个资源限制的边界,就需要提升算力、内存、带宽等。 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢1)数据中心变成token工厂:不再是存储和处理数据,而是输出token •在此基础上,Nvidia在GTC2025推出了AI工厂操作系统Dynamo。Dynamo通过将推理的不同阶段分离到不同的GPU上,把请求智能地路由到适当的GPU以避免冗余计算,以及通过在性价比最高的存储层级缓存数据以扩展GPU存储空间(显存),实现对分布式服务复杂运行的简化和自动化,NVIDIA Grace-Blackwell架构与NVIDIADynamo相结合,可将专家混合模型(MoE)的吞吐量提高50倍。 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢2)电力是AI工厂的硬性约束,算力决定营收 •2025年GTC上,黄仁勋就提到“token工厂的产出受电力限制”的观点,TPS/MW的上限是不同代际GPU之间的核心差距;•2026年3月GTC大会上,黄仁勋开始系统性的描绘“token工厂”和“token经济”的模型,指出token是新的商品(new commodity)、电力是核心限制,而不同的算力水平下,产出效率有所不同,因而算力决定营收。 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢2)电力是AI工厂的硬性约束,算力决定营收 •2026年6月中国台北GTC,黄仁勋进一步完善了AI工厂营收的模型。黄仁勋指出,GitHub呈现的下载、提交数量都在2026年快速提升,体现的是“可用AI”已来,token的需求会持续增加,而对于一个AI工厂而言,其优劣主要体现在几个方面:1)tokens/watt,同等电力下的token生产规模;2)TTFT(time to first token),启动速度;3)MTBI(mean time between interrupts),体现可靠性和稳定性;4)useful life,生命周期,体现的是适应技术更新迭代的能力。 资料来源:Nvidia GTC2026taipei,国联民生证券研究所 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢3)token分层定价和比较优势的逻辑 •2026年3月GTC上,黄仁勋提出了具体的token分层定价方案,不同的服务对应不同的价格,最低的可以是免费的,依次往上对应更大的模型、更快的速度、更长的上下文,定价也从免费提升至每百万token收费3美元、6美元、45美元,甚至150美元。 •对数据中心而言,不同的TPS/user要求下,同样的芯片配置下每MW产出效率(Token per second)会有上限,从而连结形成对应的生产曲线,而从Hopper到Blackwell再到Rubin,算力增强能够外扩这一边界。 •分层定价的环境下,数据中心需要考虑不同架构的性价比,如在免费和中等级别,Rubin效率只有Blackwell的2-3倍,而在优先级(Premium)来到了35x,体现出了比较优势。 1.2 token经济的代表:黄仁勋的“token工厂”叙事 ➢4)AI的五层架构:能源、芯片、基础设施、模型和应用 •2026年3月黄仁勋在英伟达发布文章提出AI包含5层架构: ✓1)能源为基础,AI的起步是能源转变为算力的过程,能源是根本的限制;✓2)芯片,决定了AI规模化的速度和智能的可负担程度;✓3)基础设施包括土地、能源传输、冷却、网络等各方面,能够存储信息、生成智能;✓4)模型,不止大语言模型,还包括生物、化学、物理、金融等各种类型;✓5)应用,AI产业的顶层,产生经济效益的最终环节,包括开发平台、工业机械、自动驾驶、机器人等。•前三层都是由AI工厂的内容范围。 1.3 token经济:从电力到价值创造的过程 •从能源、算力、到token、价值,token经济发展受益于多个环节的提升: ✓从能源到算力,需要有厂房土地、稳定充足的电力供给; ✓从算力到token,需要性能突出的XPU、存储、互联硬件设备,以及能充分发挥硬件性能的配套设施、可提升效率的算法优化等; ✓从token到价值,需要能完成复杂任务的先进大模型产品、优质的数据资源支持、产品使用方的行业know-how,全社会的资源利用能力等。 02 Coding之后,如何预期AI需求趋势 2.1当头部公司不再追求tokenmaxxing,如何预期token需求? •本轮增长的起点:OpenClaw为代表的Agent引发关注。2026年初爆火的OpenClaw采用“机器本地运行+通讯软件聊天”的方式,能够通过用户一句话,操作本地机器进行较为复杂的任务处理。OpenClaw推出后受到广泛关注,截至6月23日,在GitHub的Star数超过38万个。 •Agent可以调用工具和资料完成相对复杂任务,落地性更好。不同于单一chatbot,Agent能够依据用户的需求,与环境持续交互,通过搜索文件、写代码、测试等行为持续改进结果,最终形成交付,这种模式下其能够完成比单一对话更复杂的任务。 资料来源:Star History,国联民生证券研究所 2.1当头部公司不再追求tokenmaxxing,如何预期token需求? •Agent的token使用量远大于常规任务,带动token消耗显著膨胀。Agent运行过程中涉及与其他工具和内容的交互,以及自身多轮的推理、测试和反馈,因此,相比Code reasoning(无工具交互的单次问题解决)和Code chat(围绕一个问题的多轮对话),agenticcoding在输出率、token使用和最终的token花费上都显著更高。 •Token调用需求在2026年初开始加速增长。第三方token调用平台OpenRouter的数据显示,该平台的周度Token使用量自2026年初开始加速增长,此前半年仅从2025年6月底的2.11T增长到2026年1月初的7.64T,而截至今年7月初已经达到62.8T,同比增长超过23倍。 2.1当头部公司不再追求tokenmaxxing,如何预期token需求? •以2026年5月为拐点,头部科技公司“Tokenma