您的浏览器禁用了JavaScript(一种计算机语言,用以实现您与网页的交互),请解除该禁用,或者联系我们。 [全球计算联盟]:大语言模型系统级单位token能耗测评 - 发现报告

大语言模型系统级单位token能耗测评

信息技术 2026-08-09 - 全球计算联盟 木子学长v3.5
报告封面

模型需求飞速增长 能耗正在成为天花板 MMLU从60→90+,参数五年增长5000倍 2025年全球数据中心用电激增17%推理已占机器学习计算80-90%需求 中国日均token调用量:2024年初1000亿→2026年3月140万亿两年增长逾千倍 一个对话式AI年推理耗电量可能超出训练数十倍 每百万token推理电费可达1.4元占API定价的7%-28% 未来竞争不仅是模型能力的竞争,更是能效与可持续的竞争 三重困境 选型困境 场景复杂场景负载不同,最优组合各异 榜单局限只测能力,不测硬件 让选型更科学、决策更高效、部署更可靠、投入产出比更优 系统定位 差异化定位 五项核心指标 三类实际场景 W1通用文本聊天lm-arena-chatlmarena-ai/arena-human-preference-100k真实用户在LMArena上对GPT-4 / Claude / Gemini等模型的对话256请求max_output = 1024 tokens 能耗每token消耗焦耳量 GPU利用率硬件效率 TTFT首token延迟 八大主流模型 Qwen 3.5 397B-A17BMoE384E量化:FP8任务:文·代 Llama 4 MaverickMoE17B×128E +视觉量化:FP8任务:文·代·图 TPOT解码速度 MiniMax-M2.7 REAPMoE10B激活+ REAP剪枝量化:bf16任务:文·代 Gemma 4 31BDense +视觉量化:bf16任务:文·代·图 Throughput系统吞吐 MiMo-V2-FlashMoEHybrid SWA+GA量化:FP8 block任务:文·代 DeepSeek-V4-FlashMoEHybrid CSA+HCA量化:FP4 + FP8任务:文·代 Mistral-Medium-3.5-128BDense +Pixtral视觉量化:FP8 per-tensor任务:文·代·图 gpt-oss-120bMoE5B激活,128E + hybrid SWA量化:MXFP4 4-bit任务:文·代 统一测试环境 规范测试流程 硬件8 xNVIDIA 下载模型+ HF cache准备 启动vLLM Docker容器 软件栈 ml-energy/benchmark v3.0Benchmark框架 等待/health就绪(≤ 600 s) Zeus开启双能耗窗口 vLLM 0.19.1 (Docker)推理引擎 Zeus 0.13.1能耗测量库 并发发送256/1024请求 Prometheus旁路采样 Prometheus +vLLM/metrics运行时观测 transformers 5.5.4Tokenizer / Config 场景负载决定能耗基线场景负载:文本<图像<代码能耗梯度:文本<图像<代码 同一模型在不同场景下性能差异较大跨任务稳定:Gemma +gpt + Llama仅轻量场景优秀:Qwen + Mistral 批处理大小是能效第一驱动力 能耗随批处理大小增大单调下降合理配置并发数对降低推理成本的收益超过模型选型本身 同硬件下模型间能耗差距也可能较大 Qwen3.5-397B与Llama4-Maverick相同的硬件、相同的精度条件下,能耗差距达到3倍以上 MoE +低比特量化能效优势显著 以gpt-oss-120B为代表的MoE配合FP8低精度路线在能效和吞吐之间取得了最好的平衡 批处理大小对GPU利用率影响有限 GPU利用率集中在40-70%批处理大小变化的影响有限 场景对GPU利用率影响较大 代码场景下GPU利用率整体高于文本场景长提示词的密集预填充使GPU得到更充分的利用 高GPU利用率≠高能效 gpt-oss-120b等GPU利用率低但能效好Mistral-Medium-3.5等利用率高但能效差能耗和GPU利用率之间存在一定的负相关性 能耗-延迟的天然权衡 TPOT随批处理大小增大而增大,是摊薄能耗的天然代价可能是由于高并发带来的计算资源争用 场景对大部分模型TPOT影响较小 低并发时大多数模型在不同场景下的TPOT几乎一致但部分模型在高并发时TPOT相较文本场景显著恶化 框架成熟度显著影响TPOT 框架适配不足的模型即使在低并发下TPOT也严重偏高瓶颈可能在单请求解码效率而非并发处理能力 TP=2是能效甜点 TP=4因通信开销抵消了计算收益TP=1在大BS下出现能耗反弹,说明单卡计算能力已经饱和 过度分卡收益有限 Gemma4只有31B参数,对8张芯片来说偏小过度分卡不提升性能,反而因为通信开销拖累整体效率 BS增加延迟,TP抑制延迟 TP的增大会显著降低TPOT(BS=8时从26ms降至10ms)BS增大则会推高TPOT(TP=1时从26ms升至58ms) 部署建议(文本聊天场景) TP=2/4,BS=64/128能耗、延迟、利用率三者最均衡的配置区间 同一模型,换引擎=换表现 推理引擎对能效的影响可能超过模型架构本身模型架构创新必须与推理框架协同,能效评测需区分模型自身能效和当前框架适配下的实测能效 能效电费映射:从能效到可感知的电力成本单位token电费=每token消耗电量×电价×数据中心电能利用效率 生产环境选型推荐按业务场景挑选 硬件方案:高精度能耗测量平台 现有能耗监测的局限 当前能耗获取高度依赖NVML或类似系统驱动接口 摒弃传统PMIC读数,在芯片供电轨道上进行侵入式能耗测量 供电轨串联精密分流电阻,利用高精度电流监控芯片进行1kHz实时采样1 采样数据经时间标定,实现Token级瞬态能量特征捕捉 RK3588边缘计算节点平台完成概念验证 实物验证方案 未来价值 揭示大规模并行下的通信能耗墙 高频侵入式测量精确定位功耗峰值(Tensor Core矩阵运算/存储控制器总线切换) 2捕捉复杂调度下的长尾能耗效应量化指令分配不均或缓存失效指导编译器算子重排 支撑亚毫秒级动态电压频率调整 给计算阶段的预判提供数据支持,支撑亚毫秒级的功率预测模型在Token级计算负载到来前,精准调整供电轨电压 描绘模型运行不同阶段的能耗特征定位Token能耗给系统的能耗优化提供精确指导 未来 绿色算力调度决策 推动能效系统优化 可量化的选型依据 从能力单点突破走向能效系统优化 为企业提供数据驱动的模型×硬件匹配决策 为智算中心提供 能效驱动的调度支撑 •本次测评由清华大学电机工程与应用电子技术系信息能源实验室、清华四川能源互联网研究院信息能源与绿色智算技术研究所、新型电力系统运行与控制全国重点实验室电化学储能高效集成与控制团队联合牵头编制,Linux基金会研究部门和SODA基金会提供开放协作生态系统支持。 •在此谨向Linux基金会、SODA基金会致以诚挚感谢。 Thank you!