Press⌘+Kto search
模型量化(Quantization)
模型与量化量化是把模型权重从 16-bit 浮点压缩到 8-bit、4-bit 甚至更低精度的技术,体积与显存占用成倍下降,是消费级硬件跑大模型的前提。
#为什么可行
训练需要高精度保证梯度稳定,但推理时权重只需要"够准"。量化算法(如 GGUF 的 k-quant、AWQ、GPTQ)通过按组缩放和重要性加权,把压缩带来的质量损失控制在很小范围:Q8 接近无损,Q4 的损失在多数任务上难以察觉,Q3 以下开始能感觉到。
#常见量化格式
- GGUF(Q 系列):llama.cpp / Ollama 生态,CPU+GPU 混合友好
- AWQ / GPTQ:vLLM、ExLlama 等 GPU 服务化场景主流
- FP8 / INT8:数据中心推理卡的新趋势
- 经验法则:显存不够就降一档量化,优先保 Q4 以上
配套工具
理解了概念,用工具直接上手验证
本页目录
- #为什么可行
- #常见量化格式
更新于 2026-10-02
#关于「模型量化(Quantization)」的常见问题
量化是把模型权重从 16-bit 浮点压缩到 8-bit、4-bit 甚至更低精度的技术,体积与显存占用成倍下降,是消费级硬件跑大模型的前提。
本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。