模型量化(Quantization)

模型与量化

量化是把模型权重从 16-bit 浮点压缩到 8-bit、4-bit 甚至更低精度的技术,体积与显存占用成倍下降,是消费级硬件跑大模型的前提。

#为什么可行

训练需要高精度保证梯度稳定,但推理时权重只需要"够准"。量化算法(如 GGUF 的 k-quant、AWQ、GPTQ)通过按组缩放和重要性加权,把压缩带来的质量损失控制在很小范围:Q8 接近无损,Q4 的损失在多数任务上难以察觉,Q3 以下开始能感觉到。

#常见量化格式

  • GGUF(Q 系列):llama.cpp / Ollama 生态,CPU+GPU 混合友好
  • AWQ / GPTQ:vLLM、ExLlama 等 GPU 服务化场景主流
  • FP8 / INT8:数据中心推理卡的新趋势
  • 经验法则:显存不够就降一档量化,优先保 Q4 以上

#关于「模型量化(Quantization)」的常见问题

量化是把模型权重从 16-bit 浮点压缩到 8-bit、4-bit 甚至更低精度的技术,体积与显存占用成倍下降,是消费级硬件跑大模型的前提。

本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具