行业研究·海外市场专题 互联网·互联网Ⅱ 投资评级:优于大市(维持) 证券分析师:陈淑媛021-60375431chenshuyuan@guosen.com.cnS0980524030003 证券分析师:张伦可0755-81982651zhanglunke@guosen.com.cnS0980521120004 核心结论 •Nebius是全栈自研AI原生云代表厂商,工程基因是核心壁垒。公司脱胎于Yandex,继承20年分布式基础设施能力,形成“裸金属算力→多租户云→Token Factory托管推理(25年底落地)→智能代理层(规划)”的四层产品架构。Nebius代表的不仅GPU租赁商,而是一种"全栈垂直整合"的新兴AI云范式——通过硬件自研、编排自控、模型自优化的三层能力叠加,将开源模型的推理成本最高砍掉70%,从而推动AI推理从"闭源模型依赖"向"开源模型替代"的结构性迁移。 •底层:自研高密度ODM机架与工程基因构建成本护城河。比较AWS,AWS微调的TCO(总拥有成本)比Nebius贵43%,推理TCO(总拥有成本)贵112%。新兴云具备裸金属去虚拟化、InfiniBand直连、无通用云搭售等成本优势。特殊的是,根据SemiAnalysis和官网,Nebius是唯一一家使用定制ODM机箱的新兴云厂商,预计节省10-15%OEM溢价。根据官方白皮书,自研液冷方案将服务器功耗降低约20%。除此以外,Nebius拥有GPU弹性打包+双栈调度回收侧优化,相比较其他新兴云能够回收约5-15%闲置算力。 •中层:Token Factory通过收购Eigen AI实现模型层全栈优化,帮助提升单GPU收入,客户部署成本下降。Eigen推理优化让单卡Token吞吐提升2-3倍,从而把单卡Token产出提升至2-3倍,与此同时,Token价格基本和原模型一致。所以,同样的硬件成本Nebius能卖出更多收入。除此以外,对于客户来说,Nebius Token Factory的Token优化能力可有效降低客户AI推理部署的全链路成本。传统部署路径下,客户若选择裸金属自部署,需要用更多的卡完成同等每日Token量需求。 •Token Factory案例一定程度证实了"开源替代闭源模型"的经济性。Revolut因成本失控从顶尖闭源模型全面迁移至Token Factory上的Kimi 2.5;Cosine因银行/国防客户的数据不出墙要求,通过Papyrax后训练框架将Llama 3.3 70B调教至OpenAI O3水平。非Nebius案例同样印证趋势:Shopify将Qwen3-32B微调后推理速度2.2倍、成本下降68%;Coinbase形成"开源模型GLM-5.2、Kimi2.7承接常规调用、闭源模型处理复杂任务"的分层架构,AI支出接近减半。 目录 Nebius与传统云比较01Nebius成本、Token优化02Token优化案例0304Nebius财务分析 Nebius:欧洲为主的算力租赁厂,工程基因是是底层优势 •Nebius是一家总部位于荷兰阿姆斯特丹的AI原生云基础设施公司,2024年完成重组后定位为"从硅片到API"全栈自建的AI云。 •Nebius拥有接近20年的互联网基础。它脱胎于纳斯达克上市科技巨头Yandex(前身为"俄罗斯谷歌+优步),继承了上千名顶尖分布式软件工程师与20年的大厂全栈内功;在其他AI云在当靠出租GPU赚差价时,Nebius已经凭借超大规模调度、自动化故障自愈以及深度的网络软件拓扑能力,将昂贵的万卡集群打造成了无缝续传、压榨出极限性能的“精装自动化AI工厂”。 Nebius:管理层经验深厚,延续Yandex技术积淀 •Nebius由Yandex联合创始人Arkady Volozh带领,管理层长期深耕搜索、云计算、分布式系统及数据中心建设,具备大型科技平台从技术研发到商业化运营的完整经验。 •根据公司披露,Nebius承接Yandex核心技术团队,公司披露拥有超过1000名具备长期协作经验的AI工程师,覆盖AI基础设施及相关技术研发。成熟的工程团队与软硬件一体化能力,有望缩短AI基础设施建设周期,并支撑公司由底层算力向多租户云、托管推理及全栈AI云平台持续延伸。 Nebius:从基础设施租赁到Token Factory,软件附加值增加 •Nebius的产品战略围绕"四层架构"展开,核心逻辑是:越往上层走,可服务的客户群数量呈十倍增长、差异化以及软件附加值越高。①裸金属基础设施(按兆瓦计费,服务微软/Meta级别的超大客户);②多租户AI云(按GPU小时计费,面向数百至数千家研究团队);③Token Factory托管推理平台(按Token计费,支持60+开源模型);④以及规划中的智慧代理层(按任务计费,让开发者只需提需求、平台自动决策模型调用路径)。 NeoCloud vs传统云:从资源切分转向算力聚合 •传统云的很多能力,在AI场景里并不是最核心的,甚至可能拖累AI集群性能。传统云(如AWS、Azure)是为“切分资源”而生;而AI算力集群需要的是“聚合资源”。传统云时代,Amazon等公司靠虚拟化、安全隔离、自研NIC、自研SSD建立优势;但在AI GPU集群里,客户往往不是租一颗GPU、用几个小时就还回去,而是整租、长周期租赁。 •有损的虚拟化与安全隔离:传统云的核心商业模式是把一台物理服务器切分成100个虚拟机(VM)卖给不同客户。NeoCloud直接提供裸金属服务器,去除了传统云复杂的虚拟化软件层(Hypervisor)。在GPU虚拟化实例里,hypervisor拦截GPU command、内存请求、网络包带来的性能损耗率,通常在10-15%区间,AI负载下会放大到20-25%。 •RoCE vs InfiniBand:架构分歧。AI训练的核心瓶颈不是计算,而是通信。大规模训练采用标准是NVIDIA Quantum-2 InfiniBand,流控机制基于信用的(credit-based)——发送端有明确的信用额度,不会超发。商业本质英伟达全家桶,极致性能,但存在生态锁死问题。大多数传统云厂商采用RoCE或变种,在标准以太网上"嫁接"RDMA能力。 Nebius租赁成本低,推理效率更高 •根据Nebius官网,比较AWS,AWS微调的TCO(总拥有成本)比Nebius贵43%,推理TCO(总拥有成本)贵112%。平均问题解决时间12分钟;3000块GPU能稳定运行近57小时。CoreWeave在官网同样表示,其基础设施可帮助客户实现高达20%的MFU提升和96%的吞吐量,我们总结核心原因包含: •前文所述,裸金属去Hypervisor(虚拟化软件层)、IB网络+Slurm调度; •无通用云搭售。在AWS租用带GPU的虚拟机= GPU硬件成本+数据中心成本+S3研发摊销+VPC研发摊销+IAM摊销等200+种服务;对比来看,Nebius的内部成本:GPU硬件+数据中心+AI云平台,没有为200种服务的开销要分摊。 •IDC优势:NBIS芬兰75MW自营(310MW在建),能源成本低。 Nebius租赁成本低外,采购效率和灵活性优于传统云 •除了成本优势外,根据Opslyft,Nebius的其他优势包含: •H100和H200的可用性。热门区域的AWS p5容量仍然需要提前数周预订或加入企业折扣计划。Nebius H100、H200和BlackwellB200 SKU可立即按需使用。•采购流程更简便。创始人只需一张公司信用卡,即可在几分钟内启动一个配备8个GPU的Nebius节点。而AWS的同类服务通常需要经过采购、EDP协商以及长达数月的容量分配谈判。•默认使用InfiniBand。Nebius HGX H100节点出厂时即配备InfiniBand,用于多节点训练。在AWS上,等效的EFA网络功能捆绑在特定的实例系列中,需要配置放置组。 图:Nebius官网对公司优势的表述 传统云受限于组织以及生态绑定 •对于大模型公司来说,谁能更快把可用算力交付,谁就有价值。 •传统云并非完全无法实现AI原生云的极致性能,其核心瓶颈源于底层架构的基因冲突。传统云庞大的成本结构与僵化的产品生态也限制了其竞争力。传统云厂商背负着数百种通用云服务的研发与运维成本,这些隐性开支最终都会摊销到GPU租金中,使其在面对垂直AI云厂商时缺乏价格弹性。同时,传统云倾向于通过“全家桶”式的生态绑定来锁定客户。 •大云厂商纷纷自研AI芯片、降低对英伟达依赖的趋势。英伟达主动将NeoCloud作为核心战略抓手。①AI工厂设计与支持:根据官网,Nebius与英伟达扩展全栈AI云,涵盖合作设计资料获取、设计评审与验收流程、早期样品及系统软件支持、系统启动调测支持,以及定期的系统级合作伙伴业务与技术复盘;②融资与债务背书:为NeoCloud厂商的债务融资提供担保,降低其融资成本;③直接股权投资:对CoreWeave、Lambda、Nebius等头部厂商均有战略持股,深度绑定利益。例如,NVIDIA将向Nebius投资20亿美元。 Nebius的Token Factory模式:软硬件垂直整合 •Token Factory是Nebius于2025年11月推出的托管推理平台。定位不是"模型超市"(像AWS Bedrock那样聚合100+个模型),而是"模型工厂"——把60+个开源模型(DeepSeek、Llama、Qwen等)像产品一样精加工,将每个模型的推理成本砍掉最高70%,再以透明的Token定价对外输出。 •大厂云能做功能对等的产品,但较难Token Factory的成本结构。因为Token Factory的70%降本不是某一层的优化结果,而是ODM硬件、Eigen CUDA Kernel、推理调度三层垂直整合的叠加效应,除此以外,大厂硬件团队和推理团队分属不同P&L各自优化各自的目标。比如NBIS拥有"优化吞吐→更少GPU →赚更多"的激励,AWS销售KPI是卖GPU-hour,缺少动力帮客户进行优化。 目录 Nebius与传统云比较01Nebius成本、Token优化02Token优化案例0304Nebius财务分析 Nebius优化硬件层:自研高密度ODM机架+液冷 •根据SemiAnalysis,追踪每家GPU云服务商的总体拥有成本,Nebius是唯一一家使用定制ODM机箱的neocloud服务商。与此同时,还开发自己的专有固件。避免了会推高故障率和排障开销的继承性设计问题。这些设计共同帮助确保集群保持稳定,工作负载运行无意外中断维护快速且可预测。这意味着客户总体拥有成本降低,我们预计节省10–15%。 •液冷方面,两套冷却系统并存——空气自由冷却(Nebius自研)+闭环液冷(NVIDIA设计)。Nebius的服务器为高封装密度和可预测的功耗行为设计,能够让服务器在比现成硬件通常容忍的更宽温度范围内可靠运行。根据公司白皮书,配合创新的冷却布局,将服务器功耗相比标准OEM服务器降低约20%。 数据来源:公司官网,国信证券经济研究所整理 Nebius优化硬件层:自研高密度ODM机架+液冷 •硬件优化能力主要来自: •硬件工程设计能力积累:工程师大多从Yandex转移过来,15-20年拥有建hyperscaler级基础设施基础,包含能设计数据中心、主板、服务器、机架、连接器、液冷的硬件团队; •与英伟达深度合作:Yandex曾是英伟达在欧洲最大的客户之一; •算力基本自主控制:IREN(极重,纯自建)>Nebius(偏重,全自建各占75%)>CoreWeave(由轻转重,土地电力租赁为主转到局部收购)>Oracle(由重转轻,核心自建+边缘租赁)。 Nebius优化编排层:GPU直通弹性打包×双栈编排 •Nebius在GPU直通之上加了一层弹性打包,减少闲置资源浪费,公司表示这是与裸金属服务商的关键差异。根据官方白皮书