Press⌘+Kto search
KV Cache
模型与量化KV Cache 是推理时缓存的注意力键值张量,用空间换时间:没有它每生成一个词都要重算全部历史,有了它生成速度才能保持稳定。
#为什么显存占用随对话变长
注意力机制需要每个历史 Token 的 Key/Value 向量参与计算,缓存这些向量就是 KV Cache。它的大小与"参数量 × 上下文长度"成正比——这就是长上下文会吃显存的原因。以 8B 模型为例,4K 上下文约占 0.5GB,32K 上下文可能超过 4GB。
#控制手段
- 按需设置上下文长度,不要无脑拉满
- GQA(分组查询注意力)架构天然压缩 KV,新模型普遍采用
- KV Cache 量化(部分推理引擎支持 8-bit KV)
- 多轮对话定期做摘要重置历史
本页目录
- #为什么显存占用随对话变长
- #控制手段
更新于 2026-10-02
#关于「KV Cache」的常见问题
KV Cache 是推理时缓存的注意力键值张量,用空间换时间:没有它每生成一个词都要重算全部历史,有了它生成速度才能保持稳定。
本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。