QLoRA

微调训练

QLoRA 把基础模型量化到 4-bit 再做 LoRA 训练,显存约 0.9GB/1B 参数,让 24GB 消费级显卡也能微调 32B 模型,是低资源微调的事实标准。

#三个关键技术

QLoRA = 4-bit NF4 量化存储权重 + 双重量化(量化常数也量化)+ 分页优化器(显存不足时把优化器状态暂时挪到内存)。训练时权重按需反量化到 BF16 参与计算,梯度只流向 LoRA 适配器,所以基础权重的 4-bit 存储不影响训练精度下限。

#什么时候选它

  • 单卡 24GB 以下想微调 13B 以上模型:QLoRA 几乎是唯一选择
  • 效果对比:多数下游任务与全参微调差距在 1% 量级
  • 搭配 paged_adamw_8bit 与梯度检查点可进一步压缩峰值显存
  • 训练速度比 LoRA 慢 20-40%(反量化开销)

本页目录

  • #三个关键技术
  • #什么时候选它

更新于 2026-10-02

#关于「QLoRA」的常见问题

QLoRA 把基础模型量化到 4-bit 再做 LoRA 训练,显存约 0.9GB/1B 参数,让 24GB 消费级显卡也能微调 32B 模型,是低资源微调的事实标准。

本词条属于微调训练分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具