Q4_K_M 量化等级

模型与量化

Q4_K_M 是 GGUF 生态最流行的 4-bit 量化档位,约每 1B 参数占 0.6GB,质量与体积的最佳平衡点,也是 Ollama 等工具的默认选择。

#命名怎么解读

Q4 表示权重主精度为 4-bit;K 指 k-quant 分组量化(按块缩放,比朴素 Q4 精度高);M 是 Medium,表示混合精度策略中的中等方案——对更敏感的部分层用更高精度。同族还有 Q4_K_S(Small,更小略差)与 Q4_0(朴素量化,已少用)。

#实际占用参考

  • 7B 模型 Q4_K_M:约 4.4GB
  • 14B:约 9GB
  • 32B:约 19.5GB
  • 70B:约 42GB
  • 另加 KV Cache 与约 1GB 运行开销,具体随上下文长度变化

#关于「Q4_K_M 量化等级」的常见问题

Q4_K_M 是 GGUF 生态最流行的 4-bit 量化档位,约每 1B 参数占 0.6GB,质量与体积的最佳平衡点,也是 Ollama 等工具的默认选择。

本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具