在中国统筹人工智能基础设施:一个碎片化且高价值市场的崛起领导者 —— 2026 人工智能基础设施编排平台白皮书 1 从碎片化到协同化——在多芯片世界中实现可扩展人工智能 ❑ 人工智能工作负载正超越硬件效率提升而扩展 ❑ 人工智能的扩展正从芯片级性能转向集群级基础设施 ❑ 多芯片共存正成为中国人工智能生态系统的结构性特征 三层问题框架:异构性 + 效率 + SLA ❑从资源管理到系统级协调 ❑ vGPU和ModelHub作为互补层,形成集成AI基础设施编排 人工智能工作负载正超越硬件效率提升而扩展。 在基础模型突破和企业应用推动下,AI工作负载的扩展速度已超过单芯片性能的提升。 对AI的需求正日益由推理驱动而非训练,这导致了持续且可扩展的计算消耗。 推理与非推理 Token 趋势。自 2025 年初以来,通过推理优化模型路由的所有 Token 的份额稳步上升。该指标反映的是推理模型服务的所有 Token 的比例,而非模型输出中“推理 Token”的份额。 .数据显示出一个明确的结论:以推理为导向的模型正成为默认路径。实际工作负载,以及流经它们的代币份额,现在已成为衡量用户...想要与人工智能系统互动人工智能进入推理驱动时代 人工智能的扩展正从芯片级性能转向集群级基础设施。 随着推理工作负载持续活跃、大规模并发和日益分布式,AI扩展越来越依赖于大规模GPU集群基础设施,而非独立芯片性能。 人工智能基础设施正演变为一个持续活跃、分布式且高度协同的GPU集群系统。 • 人工智能工作负载的快速增长正推动中国计算基础设施容量的加速扩张。• 人工智能基础设施的扩展越来越依赖于扩展分布式计算能力,而非逐级提升芯片层面的性能改进。 随着中国人工智能基础设施的快速扩展,国内加速器正越来越多地与NVIDIA GPU部署使用,这进一步增加了基础设施的异构性和系统协调的复杂性。 人工智能基础设施的扩展正日益成为一个系统协调的挑战,而非硬件扩展的问题。 多芯片共存正成为中国人工智能生态系统的结构性特征。 与传统围绕相对统一硬件生态构建的计算环境不同,中国的AI基础设施正日益呈现出多种加速器架构、软件栈和部署环境并存的特点。 NVIDIA生态系统 H100/H200/B200A100/B800/L40s…. 缺乏统一软件栈 不同的加速器供应商通常依赖不同的运行时、编译器和算子适配框架,这增加了跨平台部署的复杂性。 基于CUDA的基础设施为训练和推理环境提供了相对标准化的运行时、算子和部署工作流程。 30% 100% 利用率 利用率 针对工作负载的优化 供应链多元化 成本与部署灵活性 • 出口限制和国内生态系统发展正加速多芯片部署在中国的人工智能基础设施中。 • 不同的加速器正越来越多地为不同的AI工作负载进行优化,推动长期多芯片共存。 企业正采用混合芯片部署策略,以提高成本效益和基础设施的灵活性。 异构基础设施现实 三层问题框架:异构性 + 效率 + SLA 随着中国人工智能产业的不断发展,其计算生态系统受到国际GPU(如英伟达)与日益丰富的国产AI芯片并存的共同影响。这种双轨发展并未导致单一主导平台的形成,反而促成了芯片架构、指令集和软件栈方面日益加剧的碎片化。 核心问题 多样化的芯片资产和分段的软件栈阻碍了统一的计算池化、调度和模型可移植性,导致重复适配、利用率低和部署复杂度高。 1碎片化计算资源管理 计算资源分散在多种芯片架构、供应商和管理系统之中,这阻碍了统一池化和调度。 • 多种芯片架构和供应商(英伟达、华为昇腾、寒武纪等)• 独立的管理工具和平台• 缺乏统一的控制平面 由于资源池分散,利用率低于5% 无统一的共享/调度 2 分片模型适配 模型通常在统一框架(例如PyTorch)中开发,但由于软件栈的碎片化,必须在不同芯片生态系统中反复进行适配。 • 英伟达:基于单一主导架构,拥有成熟稳定的软件生态系统。 • 国内:多家供应商独立开发软件栈,缺乏统一标准。 可用模型存在巨大差距 三层问题框架:异构性 + 效率 + SLA 在现实场景中,延迟、并发和SLA合规性等指标决定了 人工智能系统能否大规模部署。尽管模型在技术上可能运行在中国研发的人工智能加速器上,但它们往往无法达到这些生产级别的标准。因此,工作负载无法整合,导致部署分散、利用率低和成本高。 3.调度不当的异构计算:不稳定、低效且不经济 工作负载在不同任务之间以及随时间推移都是动态且不均衡的。低延迟推理工作负载使得异构计算的编排成为一项结构性必需。 从资源管理到系统级协调 资源与特定硬件紧密绑定。 分配是静态的,利用率低且分散。 端到端协调难以满足服务水平协议 从硬件管理到计算经济学 统一协调 端到端协调以确保持续满足服务水平协议 Workload-centric 关注工作负荷要求及业务成果。 动态分配 资源根据实时情况弹性分配 硬件抽象 工作负载与底层硬件差异解耦。 异构计算资源 SDC 核心原则 • 解耦:将人工智能工作负载与特定硬件的约束解耦,实现灵活部署;• 抽象:将异构计算资源抽象为一个统一资源池,简化管理。 2 为什么使用vGPU?控制平面的必要性 ❑ vGPU作为AI基础设施编排的核心层 •异构GPU编排的成熟度层次结构 ❑ vGPU作为控制平面——超越抽象 • 抽象层• 编排层• 优化层• 确定性SLA执行 ❑ 核心vGPU功能及vGPU如何创造价值 ❑ 弹性vGPU平台:大规模生产环境下的异构GPU编排 ❑区别于Kubernetes:为何不直接使用K8s?❑行业采用:从超大规模企业到新兴AI云服务提供商❑竞争格局 GPU已成为核心的基础设施,但原始GPU算力并不等同于可用计算能力。 随着人工智能从实验阶段转向规模化部署,GPU已成为核心计算资源。然而,不同的工作负载对GPU资源在时长、并发性和延迟方面提出了不同的需求。静态且各自为政的管理模式正日益导致资源浪费和交付效率低下。 开发测试 培训 推断 • 短时高频请求 • 波动的并发量和突发流量 • 低延迟和高吞吐量要求 • 需要动态调度和弹性容量 • 需要多GPU协同的长时间运行任务• 对内存容量和带宽有高要求 • 对拓扑结构和通信效率敏感• 需要稳定的资源分配和任务隔离 • 小型间歇性工作 • 多用户共享与协作访问 • 环境多变且复杂 • 需要灵活分配和快速恢复 随着 AI 工作负载的多样化,企业不仅需要更多的 GPU,还需要一种更高效的方式来整合、划分、调度和运营 GPU 资源。 从拥有GPU到高效使用GPU,是AI基础设施演进的下一步。 异构GPU编排的成熟度层次结构 随着 AI 工作负载的多样化,GPU 资源管理正从零散的单品牌集群演变为采用虚拟化和隔离技术的先进异构编排。 成熟度更高的解决方案正越来越多地将多品牌支持与先进的虚拟化和编排相结合。 vGPU作为AI基础设施的控制平面 随着异构GPU环境日益复杂,企业需要超越硬件虚拟化。vGPU提供了一种控制平面,该平面标准化了资源、协调了工作负载、提升了利用率并稳定了AI服务交付。 vGPU通过抽象、编排、优化和确定性执行,将原始GPU能力转化为SLA保障的AI基础设施。 抽象层:将异构GPU转化为标准化计算单元 抽象层是vGPU控制平面的基础。其核心任务是使GPU从固定的物理设备转变为可分配、可组合、可调度的标准化计算单元。通过屏蔽硬件差异,它为后续的编排层、优化层和确定性执行层创建了一个统一的资源语言。 A 计算虚拟化 与其将GPU作为整张卡来使用,vGPU将原始GPU计算分解为可调度的计算原子或切片,从而允许多个工作负载可以独立地消耗计算资源的不同部分。 例如,一个任务可能使用30%的计算资源,而另一个任务在同一块物理GPU上使用50%。 B 内存虚拟化 GPU内存以更细的粒度进行分配,允许工作负载请求更精确的内存量,而不是受限于粗粒度的全卡分配。 例如,工作负载可以请求6 GB或10 GB的内存,而不仅限于卡上的全部内存。 孤立 在多用户和多工作负载环境中,不同团队可以在同一块物理GPU上运行工作负载,同时计算和内存资源被隔离,以避免相互干扰并保持执行稳定性。 抽象层的价值并不仅仅在于“让GPU更小”,而是将异构硬件转化为统一资源语言,为编排、优化以及SLA(服务水平协议)支持下的执行奠定基础。 • 它将 AI 工作负载与特定硬件形态的直接依赖解耦,允许作业声明资源需求,而无需绑定到特定的物理卡。• 关于编排、优化和 vGPU 功能的后续章节将进一步探讨其他优势。 编排层:按优先级、拓扑结构、负载和资源适配进行GPU资源调度 编排层将静态分配转化为动态、基于策略的协调。通过结合业务优先级、拓扑感知、实时利用率和资源适配分析,vGPU能够实现跨异构基础设施更高效、更可预测的工作负载部署。 优先级感知调度 当多个工作负载竞争同一块GPU时,调度器会根据业务重要性和SLA敏感性来分配资源。高优先级的推理或任务关键型作业会获得更稳定的分配,而低优先级作业则按尽力而为的原则进行调度。 B 拓扑感知调度 不同的GPU和互连方式具有不同的通信特性。对于分布式训练和多卡推理,调度器会考虑NVLink、NVSwitch、HCCS或XPU Link等拓扑关系,以便将任务放置在通信成本更低且局部性更好的GPU上。 负载感知调度 调度器监控实时GPU和节点的利用率,并将新任务分配给利用率不足的资源。推理任务被分散以提升可用性和均衡性,而训练/微调任务则被打包以优化局部性和利用率。分配会根据工作负载模式进行调整,以最小化碎片化和热点风险。 资源感知调度 调度决策评估实际使用情况与分配的GPU资源。调度器不仅依赖预留容量,还会考虑实时利用率、可用余量以及可回收资源,将工作负载分配到最合适的GPU上。这种方法在最大化有效利用率的同时,也支持预留资源和可抢占资源模式。 编排层是抽象的GPU资源变得具有业务感知、拓扑感知和利用率感知的调度决策的地方。 • 通过进行全局调度决策,编排层提升了整体资源效率和任务负载的可预测性。• 关于优化和vGPU功能的更多优势,将在后文的相关章节中进一步探讨。 优化层:持续提升资源利用率,将硬件资产转化为可衡量、可操作的数字资产 优化层将GPU管理从简单的容量分配转变为效率优化。通过子GPU切片、超配、时空复用和多租户共享,vGPU将闲置或未充分利用的硬件转化为可用、可衡量和可操作的AI资源。 GPU子级切片 传统的GPU分配通常基于整卡单位或供应商定义的粗略配置。vGPU将切片细化到更小的计算和内存片段,允许多个轻量级的推理或开发任务共享一个物理GPU,同时它们只消耗自己实际需要的资源。 内存与计算超额订阅 B 实际上,任务不会同时达到峰值。超额订阅允许系统在依赖运行时调度以将实际使用量保持在安全范围内的情况下,暴露出超过静态物理限制的更多虚拟容量。这提高了资源利用率,而无需要求所有工作负载同时完全处于活动状态。 切片时间与切片空间 时间切片允许多个作业在交替的时间窗口内共享同一块GPU,这适用于突发交互式任务。空间切片允许多个任务同时占用GPU内存的不同部分或进行计算,使其适用于稳定的并发多租户使用。 多租户共享与隔离 调度决策应考虑计算能力、内存和带宽的综合适配性。不同于依赖单一指标,编排层根据多维资源需求将工作负载匹配到GPU,从而提高部署精度并减少资源争用。 优化层将GPU管理从“容量预留”转变为“效率激活”,将硬件资源转化为可衡量、可操作的数字资产,从而实现更高的投资回报率。 • AI基础设施受益于更高的利用率、更低的闲置能力和更灵活的工作负载放置。• 后续关于vGPU能力和商业价值的章节将进一步探讨其他益处。 确定性执行层:确保可预测、有保障且可审计的AI服务交