KV缓存(Key-ValueCache)是大语言模型推理阶段的核心技术:Transformer模型的注意力机制会为输入的每个token生成Key、Value向量,将其缓存后可避免重复计算,直接降低推理延迟、提升吞吐效率。而“卸载至CPUDDR5内存及NVMe存储”的本质,是长上下文大模型时代的必然架构选择:GPU自带的HBM显存虽然带宽极高,但容量成本昂贵、总量有限,当模型上下文长度扩展至数万乃至数十万token、且多任务并发推理时,全量KV缓存会远超HBM的承载上限。因此行业普遍采用分层存储方案:将最常用的热KV缓存留在HBM中,将次常用的温KV缓存卸载到CPU侧的DDR5内存,将访问频率最