再谈ARM为何受益GPU与CPU协同 glmszqdatemark2026年07月30日 推荐 维持评级 随着生成式AI大规模部署,传统依赖GPU/TPU/NPU集群的推理方案面临高成本、高能耗等挑战。Ampere AI推理优化框架(AIO)专为AmpereOne云原生处理器设计,通过与AmpereOne平台的深度协同优化,在SLM和MoE模型推理场景中实现低成本与高能效的双重突破。Fedimoss官网测试数据显示,AmpereOne 192核ARM CPU在Llama-3.2-1B上tg吞吐量达4242.553tokens/s,在Qwen3-30B-A3B(MoE)上达769.691 tokens/s,验证了ARMCPU在SLM和MoE模型推理场景中的可行性与效率。落地案例中,某加密货币服务提供商部署该方案后营销文章生成周期从2天缩短至60分钟。 跨环境异构推理:从架构趋势到工程落地。Agentic AI工作负载呈"推理-调用-决策"交替执行模式,GPU利用率间歇化,而高核心密度ARM CPU可承担请求路由、Prompt预处理、工具编排、代码执行调度、KV Cache管理及部分Decode任务。Fedimoss AITHER跨环境推理云已实现ARM CPU与GPU异构协同:MoE模型中Attention+共享专家常驻GPU、路由专家卸载至CPU内存;三级协同使KV Cache内存消耗增长显著慢于上下文长度增长;"GPU Prefill + CPUDecode"架构进一步提升异构集群整体资源利用率,降低LLM服务长期TCO。 分析师吕伟执业证书:S0590525110033邮箱:lvwei_yj@glms.com.cn 分析师郭新宇执业证书:S0590525110034邮箱:guoxinyu@glms.com.cn Arm架构已成为覆盖云、边、端全场景的统一计算底座。ARM全球开发者规模超2200万,核心竞争优势已从传统能效领先升级为兼具性能与生态的系统性壁垒。Arm AGI CPU基于Neoverse V3平台,136核、最高3.7GHz频率、12个DDR5内存,已有Meta、OpenAI、Oracle等重要客户。 集智股份:发挥ARM CPU与异构芯片优势打造ARM底座的“硅基流动”。集智股份控股子公司之江易算与Fedimoss建立合作,共建Agentic时代AI Inference生产底座:Fedimoss负责AI基础设施软件栈研究与异构推理优化,之江易算负责算力技术集成应用与企业场景交付,EasyInfer产品采用GPU+ARM AI CPU混合架构,支持48+模型渠道,面向1M长文本与代码专家场景的复杂推理,有望成为ARM底座的“硅基流动”。 相关研究 1.计算机行业周报20260725:超节点:AI宏观层的“韬定律”,超大参数模型的标配-2026/07/252.计算机行业周报20260718:豆包商业化大幕开启-2026/07/193.计算机行业2026年中期投资策略:Token经济为王-2026/07/164.计算机行业周报20260712:WAIC大会前瞻,关注国模+国芯变化机遇-2026/07/125.计算机行业周报20260705:聚焦“国模+国芯”:中国“模算协同”伟大机遇-2026/07/05 投资建议:AI基础设施正进入推理效率竞争阶段,MoE稀疏化、Agentic AI等趋势推动算力需求转向系统级效率优化,ARM CPU兼具性能与生态的系统性壁垒,将迎来重要的发展机遇。建议重点关注集智股份、中国长城、禾盛新材、广合科技等。 风险提示:CPU工程化落地不及预期风险;AI推理需求增长不及预期风险;行业竞争加剧风险。 目录 1 Ampere AI推理优化框架,重新定义可扩展AI推理...............................................................................................32跨环境异构推理:从架构趋势到工程落地.................................................................................................................53 ARM CPU迎来重要机遇:兼具性能与生态的系统性壁垒.........................................................................................84投资建议..............................................................................................................................................................115风险提示..............................................................................................................................................................12插图目录..................................................................................................................................................................13表格目录..................................................................................................................................................................13 1Ampere AI推理优化框架,重新定义可扩展AI推理 随着生成式AI大规模部署,传统依赖GPU/TPU/NPU集群的推理方案面临高成本、高能耗、灵活性不足和扩展性差等挑战。Ampere AI推理优化框架(AIO)专为AmpereOne云原生处理器设计,通过与AmpereOne平台的深度协同优化,在SLM(小语言模型)和MoE(混合专家)模型推理场景中实现低成本与高能效的双重突破,显著降低专用模型的部署门槛和推理成本。AIO通过多进程多模型并行执行实现CPU利用率最大化,展现出极高的能效比。结合Fedimoss AITHER计算云平台的弹性AI工作负载扩展与混合推理优化能力,框架可灵活支撑大规模推理任务。 数据验证了AmpereOne处理器在SLM和MoE模型推理场景中的性能,以及在真实生产环境中部署AI推理任务的可行性与效率。根据Fedimoss官网,为验证实际性能,Fedimoss在Supermicro ARS-211M-NR服务器上对多个LLM进行了真实推理测试。测试环境配置为AmpereOne 192核处理器、1024GB内存、Ubuntu 22.04系统。 测试结果显示,AmpereOne 192核ARM CPU在各模型上均表现出有竞争力的推理吞吐:Llama-3.2-1B的tg吞吐量达4242.553 tokens/s、pp+tg吞吐量达7754.516 tokens/s;Llama-3.2-3B分别为1386.766和2637.193 tokens/s;Llama-3.1-8B分别为1000.363和1456.953 tokens/s;Qwen3-30B-A3B(MoE)分别为769.691和1329.918 tokens/s。 资料来源:Fedimoss官网,国联民生证券研究所 在 实 际 落 地 案 例 中 ,Fedimoss为 某 加 密 货 币 服 务 提 供 商 部 署 了AIO+AmpereOne+ATHER方 案 , 提 供 知 识 图 谱 、Agentic Workflow和Deepresearch能力,利用知识图谱技术构建加密金融关系网络,精准识别潜在交易风险,深度分析用户交互数据,通过数据分析功能生成营销文章及传播效果分析报告。方案在高频连续推理和长上下文场景中表现稳定,无论毫秒级还是秒级响应均提供一致的用户体验。最终帮助客户降低长期功耗成本和硬件投资成本,营销文章生成周期从2天缩短至60分钟。 2跨环境异构推理:从架构趋势到工程落地 Agentic AI工作负载特征决定ARM CPU的不可替代性。Agentic应用呈"推理-调用-决策"交替执行模式,GPU利用率间歇化;系统需管理大量处于不同状态的会话;Agent需保留大量任务历史、工具输出和中间状态,推高KV Cache容量需求。该类工作负载呈现三大事件驱动特征:非线性控制流(条件分支、路径选择和复杂控制逻辑)、异步系统调用(文件I/O、数据库查询、网络请求、外部工具API调用)、动态代码执行(生成代码、解释执行并校验输出结果)。此类多任务、控制密集、I/O密集型负载难以形成稳定大批量计算,GPU并行单元易处于闲置状态。 相比之下,高核心密度ARM CPU适合处理大量独立任务、异步I/O和复杂控制流,可承担请求路由、Prompt预处理、工具编排、代码执行调度、KV Cache管理及部分Decode任务,GPU则聚焦Prefill、大规模矩阵运算等算力密集、时延敏感型工作负载。 芯片架构层面呈现CPU-GPU紧耦合集成趋势。传统AI服务器将硬件预算绝大部分分配给GPU,CPU主要承担控制面任务和数据准备。随着Agentic AI工作流、层次化KV Cache、P/D解耦及异构推理的兴起,CPU算力、核心密度和内存容量开始直接影响系统吞吐和整体成本上限。从产业趋势看,Apple Silicon、NVIDIA Grace Blackwell、DGX Spark均反映同一方向--通过更紧的互连和统一共享内存将CPU、GPU及其他加速器整合为多计算单元枢纽,缓解传统PCIe数据搬运的带宽和时延瓶颈。CPU已从加速器外围支撑设备逐步演进为异构计算、内存管理和任务调度的核心节点。 "GPU Prefill + CPU Decode"异构混合推理路径。LLM推理两个阶段资源特征差异显著:Prefill对整段输入序列并行计算、算力强度高,适合GPU;Decode迭代生成Token、反复读取模型权重和KV Cache,对内存容量、内存带宽和并发任务调度更为敏感,对模型规模和SLO允许的工作负载,可由高核心密度ARMCPU承担。基于此或可设计异构推理架构:GPU Prefill节点处理输入上下文并生成KV Cache,随后持久化到解耦的共享缓存池;ARM CPU Decode节点加载相同模型权重,从缓存池取回KV Cache执行后续逐Token生成。该架构使GPU快速释放被KV Cache锁定的显存和算力槽位,集中处理新Prefill请求;同时利用ARM CPU高核心密度和海量系统内存支持持续解码、管理并发用户会话、承载更 大长上下文状态,从而提升异构集群整体资源利用率、扩展并发上限和上下文容量,降低LLM服务长期TCO。 Fedimoss AITHER:跨环境异构推理的工程实践。Fedimoss构建了ATHER跨环境可扩展AI推理云,集中管理OCI云、Kubernetes集群和本地服务器,提供三类算力:ARM纯CPU推理(轻量级、高性价比)、CPU+GPU异构推理(计算模式与硬件精准匹配)、高性能GPU推理(高并发、长上下文)。 在ARM纯CPU推理层面,OCI Ampere CPU实例以性价比