这份研报主要分析了ARM CPU在AI推理中的发展趋势和应用前景,特别是ARM CPU与GPU的异构协同如何成为AI推理的新路径。报告指出,在Agentic AI工作负载下,高核心密度ARM CPU可以承担请求路由、Prompt预处理、KV Cache管理及部分Decode任务,而异构推理架构下MoE模型中Attention与共享专家常驻GPU、路由专家卸载至CPU内存,形成「GPU Prefill+CPUDecode」模式,进一步提升集群资源利用率,降低LLM服务长期TCO。
AI推理赛道的行业发展趋势是ARM CPU与GPU的异构协同。随着AI技术的不断发展,传统的GPU在处理某些任务时效率逐渐饱和,而ARM CPU凭借其高核心密度和低功耗特性,在AI推理任务中展现出巨大潜力。特别是在Agentic AI工作负载下,GPU利用率趋于间歇化,ARM CPU可以承担更多任务,从而实现更高效的资源利用和更低的成本。这种异构协同模式正在成为AI推理的新路径,推动整个行业向更高效、更智能的方向发展。
研报重点分析了ARM CPU在AI推理中的应用场景和技术优势。报告通过实测数据验证了ARM CPU在推理性能上的优异表现,例如Fedimoss数据显示,AmpereOne 192核ARM CPU在AIO框架优化下,Llama-3.2-1B吞吐量达4242.553 tokens/s,Qwen3-30B-A3B达769.691 tokens/s。此外,报告还分析了集智股份在ARM CPU领域的布局,包括其控股子公司之江易算掌握的FPGA、CPU、GPU软件异构计算核心技术,以及与Fedimoss的战略合作,共同打造Agentic时代AI Inference生产底座。
目前AI推理市场正处于快速发展阶段,ARM CPU与GPU的异构协同成为新的技术趋势。随着AI技术的不断进步,对推理性能的需求也在不断增加,ARM CPU凭借其高核心密度和低功耗特性,正在逐渐成为AI推理市场的重要力量。报告中提到,某加密货币服务商部署ARM CPU后,营销文章生成周期从2天缩短至60分钟,验证了ARM CPU在推理性能上的优异表现。这表明ARM CPU在AI推理市场具有巨大的应用潜力,未来有望进一步推动市场的发展。
研报提到了两个主要的风险提示:一是商业化落地进度不及预期,ARM CPU和GPU的异构协同技术虽然前景广阔,但在商业化落地过程中可能会遇到各种挑战,如技术成熟度、市场需求等,如果商业化进度不及预期,可能会影响企业的盈利能力。二是行业竞争加剧,随着AI推理市场的快速发展,越来越多的企业开始进入这一领域,竞争将变得更加激烈,如果企业不能保持技术领先和市场份额,可能会面临较大的竞争压力。