KV Cache

模型与量化

KV Cache 是推理时缓存的注意力键值张量,用空间换时间:没有它每生成一个词都要重算全部历史,有了它生成速度才能保持稳定。

#为什么显存占用随对话变长

注意力机制需要每个历史 Token 的 Key/Value 向量参与计算,缓存这些向量就是 KV Cache。它的大小与"参数量 × 上下文长度"成正比——这就是长上下文会吃显存的原因。以 8B 模型为例,4K 上下文约占 0.5GB,32K 上下文可能超过 4GB。

#控制手段

  • 按需设置上下文长度,不要无脑拉满
  • GQA(分组查询注意力)架构天然压缩 KV,新模型普遍采用
  • KV Cache 量化(部分推理引擎支持 8-bit KV)
  • 多轮对话定期做摘要重置历史

本页目录

  • #为什么显存占用随对话变长
  • #控制手段

更新于 2026-10-02

#关于「KV Cache」的常见问题

KV Cache 是推理时缓存的注意力键值张量,用空间换时间:没有它每生成一个词都要重算全部历史,有了它生成速度才能保持稳定。

本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具