您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [未知机构]:算力租赁深度电话会系列之KimiK3发布对算力部署与Token工厂等算租模式的影响20260720 - 发现报告

算力租赁深度电话会系列之KimiK3发布对算力部署与Token工厂等算租模式的影响20260720

2026-07-20 未知机构 飞鹤萘酚
报告封面

本次电话会议围绕KimiK3模型发布对算力部署与Token工厂等算力租赁模式的影响展开深入探讨。核心结论是:KimiK3参数规模为2.8万亿,是智谱GLM5.2(约7400亿参数)的3.5-4倍,其算力成本相应为智谱的3.5-4倍,定价也锚定于此。但K3并不会大幅冲击智谱的份额,两者定位不同——K3更偏向多模态全场景对标Claude,智谱则专注编程与软件工程,高性价比仍是开发者选择的关键。在算力部署方面,B300仍是当前最具性价比的方案,海外部署成本远低于国内;国产超节点(如昇腾910B/910C)成本高昂,Token生产效率接近2-4台B300,但与英伟达方案仍有差距。Token工厂的盈利核心在于设备采购成本、运营效率及出海能力,未来最大风险来自新技术(如RubinNVL72+LPX组合)带来的硬件贬值。 核心要点如下: K3与智谱的竞争关系:K3参数约2.8万亿,成本是智谱GM5.2的3.5-4倍,定价也相应为3.5-4倍(100元vs28元)。但两者并非直接竞争——智谱主要服务编程与软件工程客户,这些客户不会因K3在多模态领域的优势而更换更昂贵的产品。K3真正抢夺的是MiniMax、千问、Anthropic和GPT的份额。 算力部署方案: 海外:两台B300即可部署K3,总成本约150万美元(设备+网络),折合人民币约1000万。 国内:B300售价已涨至1350万/台,两台需2700万;国产超节点(910B/910C)成本约1-1.5亿元,新950系列预计2-3亿元。 效率对比:一台超节点(910B/910C)的Token生产效率约等于2-4台B300,但受限于推理引擎优化和通信效率,实际性价比不如英伟达方案。 Token工厂盈利模型:以B300部署智谱GM5.2为例,理想月收入约180万元,实际运营中约40万元/月。硬性成本(电费+机柜+运维)约1.5万元/月,净利润约38.5万元/月(假设设备不折旧)。设备采购成本是影响回报率的最关键因素。 Token降价预期:历史上云服务多为降价趋势,但2026年供应链从硬件到软件均在涨价。即使Token单价下降,推理引擎优化可能提升产出效率,总产值未必下降。若Token降价而租金固定,Token工厂可能亏损。 闲时租赁与出海:同时服务国内和海外的Token工厂因合规问题难以实现(物理隔离要求)。出海需将设备部署在汕头、上海临港、海南洋浦等特殊监管区,无法兼顾国内需求。 新技术风险:英伟达RubinNVL72+LPX组合(1500万美元)宣称可达10台GB300的效能(约100台B300),若兑现将导致B300、H300等现有设备大幅贬值。 市场规模与需求:国内AI算力需求增速超50%,远超产能增长。智谱几乎无自有算力,需求全部外溢给第三方;字节虽有自研芯片和运营商合作,但仍需大量采购第三方算力。 会议实录 算力成本与定价分析 假设算力成本基数一致,K3的算力成本应该是智谱GLMM5.2的3.5倍以上。由于K3的参 数尚未公开,第三方机构除我们外均未进行测试,我们只能估算。目前估计K3的效率不会高于智谱,这意味着其算力成本是智谱的3.5倍到4倍。 从定价来看,智谱GM5.2的输出定价为28元,KimiK3为100元,差不多也是3倍多。这个定价从侧面反映了K3的成本是智谱的3.5倍到4倍,其售价也相应设定在3.5倍到4倍之间。K3在定价时充分考虑了与GM5.2的竞争关系。从算力成本、成本和售价来看,两者非常匹配——我的成本是你的3.5-4倍,所以我的售价也是你的3.5-4倍,这是非常合理的。 从技术参数和售价策略来看,两者是吻合的。剩下的问题是开发者会如何选择。目前海外大部分中立评测机构认为,K3在性能上已超越智谱GM5.2的很多方面,且是多模态模型,适用场景更全面,对标的是Claude。而GM5.2对标的是OpenAI。 但市场需要的是什么呢?市场更需要的是性价比。作为开发者,大多数还是会选择智谱GM5.2。因此,市场对K3的反应有些过激,认为K3超越智谱GM5.2后大家都会改用K3,这是一个错误的想法。大范围使用智谱GM5.2的客户主要是做软件工程和编程的,他们不会因为K3在多模态等领域整体超越,就选择一个比智谱贵几倍的产品。K3可以抢夺MiniMax、千问的份额,尤其会抢Anthropic和GPT的份额,但不太会影响智谱GM5.2的份额。两者不在一个竞争维度上。 超节点部署与成本 超节点肯定可以部署K3。我们所说的超节点,大概率指英伟达的GB200、GB300及其下一代RubinNVL72,或者国内的昇腾910B、950等。 国产超节点的优势在于,卡间互联比英伟达更快。以昇腾为例,其卡间全部采用光互联,而英伟达超节点采用铜缆加光缆的组合。因此,在互联速率上,华为的910B、910C和950确实占有优势。但在模型适配、底层推理框架和推理引擎适配方面,英伟达仍占较大优势。 部署成本方面,海外部署K3的最低成本约150万美元——两台B300约120万美元,加上交换机、光模块等约30万美元,折合人民币约1000多万。B300在中国市场的售价为1350万元,两台国内部署成本约3000万元。 而国内超节点,以910B和910C为例,384节点显存远大于B300,成本约1亿元(风冷),液冷版本约1.5亿元。国内超节点部署成本很高,因为整体算力和显存都跟不上,造价昂贵。950系列目前尚未报价,预计接近2-3亿元。 海外方面,GB200约400万美元,GB300约500万美元,RubinNVL72报价约800万美元。 英伟达B300集群与国产超节点集群的权衡 在Token分成模式下,算力租赁厂商需权衡成本、稳定性及交付能力。由于官方数据与实际生产数据存在差异,我只能基于实际生产结果分享。 国内超节点以昇腾910B为例,生产Token的效率(以智谱GM5.2为例,K3尚无安装数据)约为两到四台B300。两台B300是指原始效率,四台是指推理引擎及内存优化后的效率——经过优化后,两台B300的Token生产效率差不多可达一台超节点水平。 由于供应链问题,B300从400-500万炒到1300多万,两台约2700万,基本能达一台超节点的生产效率。K3可部署在超节点和B300上,评估认为910B和910C的Token生产效率接近两台B300。950系列尚缺乏数据依据。 参数与成本的关系 参数并非完全等比例增加成本。智谱GM5.2约7400亿参数,K3约2.8万亿,接近4倍。部署成本方面,存储和显存倍数与参数等比例,但Token产出效率不同——越小的模型效率越高。 用一台B300部署GM5.2,四台部署K3,两者Token产出效率不一致。同等架构下,参数 越小,Token生产效率越高。K3还有静候机制,也会导致速度更慢。 GM5.2的专家分布在8张卡内,K3分布在16张卡内,卡间互联速度不及机内,越大的集群通信效率越低,Token产出效率也越低。K3的部署性价比低于智谱GM5.2——四台未必有一台效率高,价格也未达到四倍。大部分Token工厂仍会选择部署智谱GM5.2,除非折扣力度加大。市场会通过价格动态平衡。 模型高端化定价对算力租赁的影响 市场供需匹配价格。当供不应求时价格上涨。各厂商的订阅制(如智谱159元/月)相对于按量付费严重亏损,意在培育市场。盈利依赖于按量付费的企业级Token。 智谱自己卖7-10折,第三方部署智谱约4-7折。K3尚无第三方部署,官方限时7折。K3出台后,智谱未出现算力供过于求,仍严重供不应求,K3对智谱市场几乎无影响。 K3虽定价更高(成本接近4倍,售价3倍多),但并未提升算力租赁转Token出售的利润比例,仍是锚定智谱。K3目前供不应求,但试后的整体评价没有媒体强调的那么高。从性价比看,K3在编程领域无法超越智谱,更像与千问和DeepSeek竞争,但价格贵很多。它打开了售价天花板,但未改变租赁转Token的利润比例,算力租赁报价不受影响。 B300Token工厂的盈利测算 以智谱GM5.2为例,一台B300经推理引擎优化后,输入约100-150万Token/秒,输出约300万Token/秒,缓存命中约500-600万Token/秒。按输出计,售价28元/百万Token,第三方通常打5折至14元/百万Token。 满负荷理论值:每分钟产出约42元,每小时2520元,每天约6万元,每月约180万元。实际运营中,因大量时间空置及效能不足,实际月收入约40万元(对比之下,DV4PRO理论月收入160万,实际仅20-30万)。 成本方面,设备折旧是最大变量。机器原400万,现1330万。目前设备不折旧反涨价,成本主要为运维费和电费。B300加环境功耗约16kW,按0.5元/千瓦时计,月电费加机房租约8000元,加运维约5000元,合计约1.5万元。 40万收入减1.5万成本,净利润约38.5万元(假设设备不折旧)。设备涨价至1350万后,需约40个月回本,已抑制设备继续上涨。海外设备约60万美元/台,未大幅涨价,回报率极高,国内企业正开始出海做Token工厂。 Token降价与利润空间保护 第一个问题:Token是否会降价?历史上云服务多降价,但2026年从硬件到软件到Token均为涨价。官方曾宣称永久二五折,7月即变为忙时五折。长期趋势Token会降价,但推 理引擎优化可能提升产出效率,总产值大概率不会下降。目前硬件供不应求,Token需求增长快于软硬件优化速度,设备产值可能继续升高。 第二个问题:若Token降价,租赁合同已谈定,租金固定,Token总产值下降则亏损。闲时租赁和Token出海是应对思路。 出海目的包括利用闲时及海外定价高。但合规要求严格——物理服务器、网络、存储必须隔离,不能同时服务国内和海外。出海设备须部署在汕头、上海临港、海南洋浦等特殊监管区,无法同时服务国内。闲时更换容器在单台服务器可行,但集群层面极难实现,现有调度方案不支持或效率低。闲时租赁实际难以操作,且存在政策风险。 未来1-3年国内CSP算力资本开支 虽未拿到BAT和运营商详细数据,但从市场行为看,需求远供不应求。海外供货显示整体加速,且超过台积电、三星、美光现有产能增长,国内更是明显。除原有大厂Capex增长30%-50%外,大量互联网及传统公司新增推理需求,算力需求增速超50%。 国内大模型厂商算力缺口与第三方租赁依赖 智谱几乎没有自有算力集群,全部为租赁,设备总集群约2000台以内(含国产和英伟 达)。未来将有多个万卡级集群(1000台8卡机以上),算力需求必然外溢给第三方,如润泽、协创等。 字节现有算力仅够C端使用,已开始与运营商合建数据中心。后续训练需大量采购新设备,包括5万片天朔之星(公开信息),以及合规的国产设备和可能进入中国的H200。字节会采用自购合规设备加算力租赁形式,但智谱没有购买渠道,算力需求全部外溢给第三方。整体需求增长超过30%,可能达50%以上。 运营商入局的影响 运营商卖Token效果不佳,原因有三:一是成本高——只能以昇腾为主,单位人民币产出的Token数量远少于英伟达,导致售价高;二是决策机制慢,跟不上Token价格波动;三是专业度不足,缺乏成熟的云团队。 运营商刊例价是字节的两倍,需打5折才能竞争,且仍难敌官方原厂。目前运营商对市场格局影响不大。未来,运营商在Token工厂运营方面有天然优势(机房、网络、客户经理、营业厅),但需等模型稳定成熟后,优势才能发挥,至少需要几年时间。 算力卡残值贬值风险 残值大幅贬值的风险确实存在。算力市场正变得大宗商品化,HBM在AI服务器中占比已超GPU(RubinNVL72中GPU仅占25%,存储超30%),导致价格大幅波动。历史上电子产品三年贬值70%,但2024年的4090显卡从16000元涨至25000元,已无法以历史经验判断。 新 技 术 带 来 的 风 险 尤 为 突 出 。英