Press⌘+Kto search
QLoRA
微调训练QLoRA 把基础模型量化到 4-bit 再做 LoRA 训练,显存约 0.9GB/1B 参数,让 24GB 消费级显卡也能微调 32B 模型,是低资源微调的事实标准。
#三个关键技术
QLoRA = 4-bit NF4 量化存储权重 + 双重量化(量化常数也量化)+ 分页优化器(显存不足时把优化器状态暂时挪到内存)。训练时权重按需反量化到 BF16 参与计算,梯度只流向 LoRA 适配器,所以基础权重的 4-bit 存储不影响训练精度下限。
#什么时候选它
- 单卡 24GB 以下想微调 13B 以上模型:QLoRA 几乎是唯一选择
- 效果对比:多数下游任务与全参微调差距在 1% 量级
- 搭配 paged_adamw_8bit 与梯度检查点可进一步压缩峰值显存
- 训练速度比 LoRA 慢 20-40%(反量化开销)
本页目录
- #三个关键技术
- #什么时候选它
更新于 2026-10-02
#关于「QLoRA」的常见问题
QLoRA 把基础模型量化到 4-bit 再做 LoRA 训练,显存约 0.9GB/1B 参数,让 24GB 消费级显卡也能微调 32B 模型,是低资源微调的事实标准。
本词条属于微调训练分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。