Press⌘+Kto search
知识蒸馏(Distillation)
模型与量化知识蒸馏是让小模型学习大模型输出的训练方法:大模型当老师生成高质量样本,小模型在其上训练,以小模型的成本获得接近老师的效果。
#与量化的区别
蒸馏压缩的是"模型本身"——重新训练一个更小的模型;量化压缩的是"权重的精度"——模型结构不变。两者可以叠加:DeepSeek-R1-Distill-Qwen-7B 就是先蒸馏(把 R1 的推理能力蒸给 Qwen 底座)、再量化成 GGUF 分发的产物。
#怎么读模型名
名字里带 "Distill" 的模型(如 DeepSeek-R1-Distill-7B/14B/32B)即蒸馏产物,后面的数字是学生模型的参数量。它们保留了老师在特定能力(如数学推理)上的大部分表现,是消费级硬件跑推理模型的主流选择。
本页目录
- #与量化的区别
- #怎么读模型名
更新于 2026-10-02
#关于「知识蒸馏(Distillation)」的常见问题
知识蒸馏是让小模型学习大模型输出的训练方法:大模型当老师生成高质量样本,小模型在其上训练,以小模型的成本获得接近老师的效果。
本词条属于模型与量化分类,与 、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。