您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [美银证券]:内存行业:开源模式如何扩大总可寻址市场空间 - 发现报告

内存行业:开源模式如何扩大总可寻址市场空间

信息技术 2026-07-20 美银证券 故人
报告封面

《记忆的价值》,以及为何“开源”能扩大目标市场 行业概览 2026年7月20日 中文开源大模型对内存需求构不成威胁开源模型最新发布,包括中国Kimi K3于7月16日推出,强化了我们对内存/MU的乐观判 美国半导体联合公司 断。从宏观角度看,我们认为中国开源模型API定价(比西方模型便宜5-350倍)反映了商业模式选择,而非必然反映硬件成本。重要的是,这些模型采用多种效率技术(下文详述),能够降低计算/GPU强度,但其模型权重和活跃参数增加时,需要相同或更多的内存。我们还需指出,每次开源权重下载都会在客户端创建一个新的内存插槽,这在封闭模型环境下是不会存在的。 vivek.arya@bofa.com阿亚尔·维韦克分析师BofAS duksan.jang@bofa.com张杜山分析师BofAS 中文模型的费用较低,但仍然需要相同量的内存。 michael.mani@bofa.com迈克尔·马尼分析师BofAS 中国的开放模型API定价策略激进,腾讯混元(Tencent Hunyuan)每百万输入字符收费0.06美元,而Claude Opus 4.8则高达每百万输入字符15美元,即便是Moonshot AI最新的Kimi K3也仅收费3美元/百万输入字符,尽管其性能被认为“相似”。然而,我们指出API价格实为商业模式选择,未必直接反映硬件成本。例如,Kimi K3每个服务实例仍需约1.4TB的高带宽内存(HBM)来运行。这与OpenAI的“oss-120b”开放模型类似,该模型采用相同的MXFP4原生精度(针对类似压缩),拥有1200亿总参数(比Kimi K3小23倍),却仅需约63GB的权重内存来运行(小22倍)。换言之,API定价往往与总内存权重和激活参数成正比,即便是开放式的中文大语言模型也是如此。“开放”指的是权重分发,而非部署成本,客户仍需自行购买HBM、DRAM、NAND才能在自己的硬件上运行模型。 liam.pharr@bofa.com利亚姆·帕尔分析师BofAS CXMT:长鑫存储技术 效率技术、补贴或将有助于降低价格。 中国模型的定价/成本优势往往并非源于硬件。我们估计,中国的成本优势主要体现在架构效率(MoE稀疏性、MLA/混合注意力、原生FP8/MXFP4量化),以及物理基础设施效率高达1.5-2倍的提升(得益于中国更低的电力、劳动力和土地成本)。其余的定价差异可能来自与国家相关的资本补贴,以及中国云服务提供商(如阿里巴巴、腾讯、百度)的云收入/自由现金流。有趣的是,Moonshot的Kimi K3在K3发布后仅48小时内就暂停了新订阅,这可能是由于GPU容量耗尽(或为削减成本/亏损),而小米在2026年5月将MiMo模型的定价削减了99%(可能无利可图),这很可能是为了抢占市场份额。 CXMT并非威胁,重置。MU提前买入,回购恢复。我们重申建议以1550万美元的采购订单在MU买入。虽然中国本土的CXMT正积极扩张产能 (目前仅占全球晶圆产能的极低比例,约百分之低十),但我们认为人工智能内存领域的竞争有限。CXMT主要面向服务不足的消费者/大宗商品DRAM领域,而非HBM3E/HBM4。此外,美国原始设备制造商(OEM)能否尽快获得政府批准从CXMT采购仍不明确。关键在于,MU的《芯片法案》回购限制将于12月26日左右到期(自2024年12月24日首笔资金到位后两年),这将开启大规模回购的大门——鉴于其未来几年每年1200亿至1300亿美元以上的自由现金流预期。一项40%的派发政策将导致每年约500亿至600亿美元的回购,或每年为其约1万亿美元的市值约5%至6%。 美国银行证券部门与其研究报告中涵盖的发行人进行业务往来,并寻求与其进行业务往来。因此,投资者应注意,该机构可能存在利益冲突,从而影响本报告的客观性。投资者应将本报告视为其投资决策的单一因素。请参阅第12至15页的重要披露。分析师认证在第11页。价格目标依据/风险在第11页。12996267 内容 8中国代工模式制造了颠覆,但也拓展了市场,这对半导体有利。 Glossary:9 记忆在开放模型中仍然至关重要 中文模型的费用较低,但未必会低很多。 中国的开放模型API定价非常有竞争力。最新的Kimi K3收费标准为每千字符输入3美元,每千字符输出15美元,而Claude Opus 4.8和GPT-5.6的价格大约是其5倍。 然而,我们标记的API价格是一种商业模式选择,而非必然的硬件成本显示。Kimi K3仍然需要每个服务实例配备64位加速器超级节点,并包含约1.4TB的HBM内存——无论Moonshot按每百万个token收取3美元还是30美元,这些内存都是必需的。 OpenAI的类似开源模型,采用MXFP4原生精度(用于等比压缩),拥有1200亿总参数(比Kimi K3小23倍),运行时需要约63GB的权重内存(小22倍),若模型大小相同,其内存需求与K3相当。 图1:自2025年以来,全球代币使用量平均每周增长+6%,或自2026年以来每周增长+9%,其中中国模型在2026年7月占代币的约70%。 通过OpenRouter查看主要模型(API)的每周代币使用情况 成本优势通常源于非硬件效率。 我们怀疑中国大型语言模型的大部分成本优势(与西方相比高达5-50倍)实际上来自非硬件效率。 建筑效率(2-3倍) - 极端MoE稀疏性:Qwen3-Coder-Next仅激活80B总参数中的3B (~3.75%);Kimi K3激活率约为1.8%。在中文LLM中,每解码token的计算量仅为同等规模密集模型的几分之一。 - 混合注意力机制:DeepSeek 的 MLA 和 Kimi 的 KDA 相比标准注意力机制,可以将KV 缓存压缩 10-90 倍,因此批处理密度也更高——每个 GPU 支持更多并发用户。 - 本地低比特量化:Kimi K2 思考芯片采用 W4A16,K3 采用 MXFP4,DeepSeek 本地使用 FP8 进行训练。与 Meta Llama 4 或 Google Gemma 4 的开源模型相比,这提供了又一倍的吞吐量提升。 综合来看,净建筑效率每 token 可达 2-3 倍,相比之下,同等规模的西方模型若以 BF16/FP8 原生格式交付,则无法获得这些效率提升。 输入端基础设施成本 (~1.5-2倍) 中国电力:约0.05-0.08元/千瓦时,而美国超大规模数据中心区域约为0.10-0.15元/千瓦时 -中国劳动力:工程薪酬比美国同类低40-60% - 土地/房地产:数据中心资本支出及相关土地/外壳/电力支出在内陆中国(宁夏、贵州)有显著降低 综合来看,净输入成本优势也可能达到每个代币1.5-2倍,具体取决于底层计算账单。 竞争,市场份额补贴 最后,我们注意到Moonshot AI在K3发布后仅48小时内暂停了新订阅,因为GPU容量已用尽,或者可能只是为了削减成本/减少亏损。 如果 K3 的低价确实反映了硬件成本的相应节省,我们预计 Moonshot 已经准备了足够的产能。因此,Kimi K3 每个查询的实际硬件成本可能高于其远低的 API 价格所暗示的成本,Moonshot 可能正在补贴以抢占市场份额。 存在类似案例,例如小米计划在2026年5月将其米模(MiMo)型号的价格削减99%,此举可能是为了抢占市场份额。 图2:开放模型持续增加其权重大小(即内存),其API输入/输出成本通常也随权重增加而提高。开放模型定价与权重内存 开放模型持续增加其大小。前沿开放权重模型的大小持续急剧增加(封闭模型通常不发布模型权重数据): -DeepSeek-V3 at 671B (Dec 2024)-Kimi K2 at 1T (mid-2025)-DeepSeek-V4-Pro at 1.6T (Apr 2026) - Kimi K3在2.8T参数下(2026年7月16日)——有史以来发布的最大规模开放模型 更大的权重直接流向内存需求。 事实上,麻省理工学院的数据溯源审计文件记录了2019年至2025年间平均开源模型大小的增长达17倍。即使在本土MXFP4(4位)架构下,Kimi K3的模型参数现在也占用了约1.4TB空间,而Moonshot自身的指导方针要求每个服务实例配备64个以上的加速器。 重量记忆与总参数相关(例如K3的2.8T参数),而非活动参数。 即便从FP8压缩/量化到MXFP4能节省2倍的计算量,模型参数量也增长了约4倍,这足以抵消... 压缩带来的效率提升。例如,原生MXFP4格式的Kimi K3(2026年7月)所需的内存是DeepSeek-V3在FP8格式(2024年12月)的2倍。 活动参数减少计算量,而非内存。 在使用MoE(即仅使用激活参数)的情况下,Kimi K3每次仅激活896个专家中的16个,即每个token仅激活其总共2.8T参数中的50B。这大大降低了推理过程中的总计算需求。 然而,该模型仍需将几乎整个专家池(即整个模型参数)驻留在附近的内存中。事实上,HBM 容量与总参数的关系远比与激活参数的关系更密切。 这是因为MoE路由器按token动态选择专家,因此每个专家(即总权重)都必须驻留在快速内存中,无论激活稀疏性如何。结果,总参数量加倍需要每个实例双倍的HBM,这就是为什么K3需要64个以上的加速器,而V3只需要8个。 更大的模型权重驱动多层内存 最后,更大的权重迫使采用多层内存架构:热专家驻留在HBM中,非活动专家溢出到CPU的LPDDR5X/DDR5,冷KV缓存则存放在企业级NAND中。每一层在每次部署中都能存储更多内容。 图3:开放MoE模型的总参数量和每个token的激活参数量持续向上扩展,导致更大的权重用于存储内存。开放MoE模型总参数量(bn)与每个token的激活参数量(bn) 开放模型扩展内存端点与封闭模型其机制很简单:封闭式模型只有一个部署足迹;而开放式模型则有多少下载量就 有多少足迹。 例如,当OpenAI提供GPT-5.6(封闭模型)服务时,模型权重存储在少数几个微软Azure数据中心。世界上的每个用户——数百万用户——都访问同一个共享的HBM内存池。总内存容量由所有用户合并的峰值并发需求设定,并且可以分摊,因为使用模式在不同的时区和工作负载中多样化。 但当Moonshot发布Kimi K3权重(开源模型),或DeepSeek发布V3,或OpenAI发布gpt-oss-120b时,权重会被下载并加载到每位购买者自己的硬件内存中。一个运行gpt-oss-120b的企业需要自己80GB的HBM3E。一个运行DeepSeek-V3的主权云需要配置自己的8× H200集群(约1.1TB的HBM)。Moonshot对K3的自身指南要求为64+ 每份服务实例的加速器——并且,每个下载权重的企业、政府和云服务提供商都会复制这个资源占用。如果同样的智能只能通过封闭的API提供,那么这些内存本来就不会被购买,因为客户会租用计算周期而不是拥有硬件。 因此,对于开源模型,模型权重和KV缓存都必须驻留在快速内存中以便进行推理——它们不能在各自拥有的集群之间共享。与共享API不同,在共享API中,10,000名用户实际上共享同一份HBM中的权重副本,而10,000家企业自行托管相同的开源模型,则意味着有10,000份权重副本加载到10,000个独立的HBM池中。每次部署还需要根据其用户群规模独立扩展各自的KV缓存容量——在2026年常见的128K–1M上下文窗口中,每个活跃用户会话的KV缓存可以超过40GB,因此这种扩展是与每个端点的并发量独立相关的。 记忆端点受益于更低的API定价 采用独立内存端点的开放模型同样有助于端侧内存部署,因为中文大语言模型实验室收取更低的API价格,从而推动整体需求上升。换句话说: 更便宜的中国API定价 = 更多的推理工作负载