AI工作负载的算术强度(计算操作数与内存访问数据量的比值)较低,是加剧内存墙问题的重要原因。具体表现为:
数据访问需求远大于计算量:AI核心运算(如矩阵乘法)虽计算密集,但内存访问模式高度规律且需求量极大。例如,典型Transformer层的计算效率中,70%-80%受内存带宽限制,而非计算单元本身的吞吐量,说明大量时间消耗在数据搬运而非计算上 【2】 。
算力与带宽增长失衡:过去20年,AI加速器峰值算力增长9万倍,而内存带宽仅提升30倍 【1】 ;内存带宽年增速约15%,远低于算力的指数级增长 【7】 。当算术强度低时,计算单元很快完成运算,但需等待内存传输新数据,导致GPU等加速器利用率不足——如在A100上运行BERT-large模型时,计算核心利用率仅35%-45% 【2】 。
小批量流式访问放大瓶颈:AI工作负载常采用“小批量流式”处理模式,频繁的小数据块访问进一步增加了内存读写压力,与传统HPC的大批量访问模式相比,更易暴露内存带宽不足的问题 【2】 。
这种低算术强度导致计算单元“等米下锅”,成为内存墙的核心诱因之一。
© 2018-2026 苏州互方得信息科技有限公司
苏ICP备17077178号|
苏公网安备 32059002001943号|增值电信业务经营许可证:苏B2-20240803