KV 缓存(Key-Value Cache)是大语言模型推理阶段的核心技术,通过缓存 Transformer 模型生成的 Key、Value 向量避免重复计算,从而降低推理延迟并提升吞吐效率。
随着长上下文大模型的发展,GPU 自带的 HBM 显存因容量有限、成本昂贵而无法满足全量 KV 缓存的存储需求。行业普遍采用分层存储方案:
- 热 KV 缓存保留在 HBM 中
- 温 KV 缓存卸载至 CPU 侧的 DDR5 内存
- 冷 KV 缓存下沉至 NVMe 协议的企业级 SSD
形成“HBM-DDR5-NVMe SSD”的三级缓存体系。核心结论是:
- GPU HBM 无法独立满足大模型推理的 KV 存储需求
- DDR5 内存与企业级 SSD 已从服务器通用配套部件升级为 AI 算力的核心承载链路