先进计算产业发展联盟 智能计算工作组 浪潮信息叶毓睿 2026年4月 摘要 自2022年底ChatGPT引爆全球以来,大模型已成为人工智能产业最重要的技术方向。2023年Meta发布Llama系列开启了开源大模型 的新 纪元;2024年 至2026年 间,DeepSeek、Qwen、Llama3、Mistral、GLM等开源大模型在性能上不断逼近甚至超越闭源模型,深刻地改变了全球AI产业格局。开源大模型的快速发展极大降低了大模型应用的技术与经济门槛,激发了千行百业的创新活力,但同时也对底层先进计算基础设施提出了前所未有的挑战。 本研究报告系统梳理了开源大模型时代下先进计算的产业现状、关键技术演进路径与标准化需求。研究发现,先进计算正面临三大核心挑战:其一,算力需求呈超指数级增长,训练算力每6至10个月翻倍,推理需求因多步推理与智能体的普及在两年内可能增长百万倍;其二,异构算力生态出现碎片化趋势,NVIDIACUDA生态主导地位虽面临挑战,但国产AI芯片软件栈、编程接口、算子库各自为战,迁移与优化成本居高不下;其三,推理部署场景日益多元化,云端集群推理、边缘侧推理、端侧本地推理对算力、内存、功耗的差异化要求,使传统单一架构难以满足。 研究指出,先进计算正沿着AI芯片架构创新、异构融合与算力池化、先进互联网络、推理优化技术、开源软硬件协同五大方向加速演进 。其中,Chiplet芯粒技 术、HBM3e/HBM4高带宽 存储、UEC/UALink/CXL等新兴互联标准、vLLM/SGLang等开源推理框架以及Triton/OpenXLA/MLIR等开源编译生态,共同构成了先进计算演进的关键技术底座。报告特别关注了2026年4月发布的DeepSeek-V4预览版,作为开源大模型时代的里程碑事件,V4在DSA稀疏注 意力、mxFP4训练精度、国产算力Day0适配等方面的技术突破,为先进计算演进提供了重要的产业实践范本。 基于上述研究,报告在第四章针对国内外标准现状提出了三大类标准化需求建议,涵盖开源大模型与算力适配、先进计算系统与互联、开源软件栈与生态等方向,为后续标准化工作和产业协同提供了系统性参考。 目录 目录 摘要...................................................................................................2目录...................................................................................................4第一章概述.......................................................................................81.1研究背景...............................................................................81.1.1开源大模型重塑全球AI格局.................................81.1.2算力需求从训练驱动转向推理与Agent执行驱动...................................................................................................101.1.3国产算力加速崛起.................................................111.1.4先进计算成为系统级、生态级的全面演进.........121.2研究目的.............................................................................121.3研究范围.............................................................................131.4研究方法与工作计划........................................................14第二章产业现状与发展趋势........................................................162.1开源大模型生态全景........................................................162.1.1全球开源大模型主要参与者.................................162.1.2开源协议与开放程度.............................................172.1.3HuggingFace与开源模型基础设施......................182.2产业政策与战略导向........................................................182.2.1国家层面政策导向.................................................192.2.2地方层面政策实践.................................................192.2.3行业自律与标准化.................................................20 2.3主要应用场景.....................................................................212.3.1大规模预训练场景.................................................212.3.2微调与持续训练场景.............................................222.3.3云端推理服务场景.................................................222.3.4边缘与端侧推理场景.............................................232.3.5智能体与多模态场景.............................................242.4产业链格局.........................................................................252.4.1上游:核心硬件与基础设施....................................252.4.2中游:智算中心、云服务与开源软件栈................262.4.3下游:开源大模型团队、行业应用与终端............272.5发展趋势研判.....................................................................282.5.1算力供需结构持续重构.........................................282.5.2异构算力融合加速.................................................292.5.3开源软件栈成为关键变量.....................................292.5.4国产算力进入规模化应用阶段.............................292.5.5标准化成为产业协同的关键.................................30第三章先进计算的主要技术路线................................................313.1演进的总体方向................................................................313.2AI芯片架构创新................................................................323.2.1Transformer与MoE加速:从通用到专用.............323.2.2Chiplet芯粒技术.....................................................333.2.3HBM高带宽存储:HBM3e与HBM4....................343.2.4存算一体与新型计算范式.....................................353.3异构融合与算力池化........................................................35 3.3.1Scale-up与Scale-out的协同演进.........................353.3.2软件定义算力.........................................................363.3.3跨厂商异构混训与混推.........................................373.4先进互联网络.....................................................................383.4.1节点内互联:从NVLink到UALink......................383.4.2节点间互联:UEC、InfiniBand与RoCE的演进..393.4.3光互联与CPO:下一代物理层...............................393.5推理优化技术.....................................................................403.5.1KVCache管理:PagedAttention的革命................403.5.2ContinuousBatching:动态调度的力量..................413.5.3量化与低精度推理.................................................413.5.4投机解码与并行解码.............................................423.5.5长上下文优化.........................................................433.6开源软硬件协同................................................................433.6.1编译器演进:从CUDA到Triton/MLIR.................433.6.2训练框架:PyTorch生态的开放性..........................443.6.3推理框架:vLLM、SGLang、TensorRT-LLM.......453.6.4国产软件栈的演进路径.........................................463.7关键技术挑战.....................................................................