LoRA(低秩适配微调)

微调训练

LoRA 冻结原模型权重,只训练注入各层的低秩矩阵(适配器),训练参数量不到原模型 1%,显存约为推理的 1.2 倍,是个人微调的主流方案。

#原理一句话

研究发现微调引起的权重变化是低秩的:用一个秩 r(常取 8-64)的低秩分解 A×B 来表示"改动量",只训练 A 和 B。原权重不动,推理时可以把适配器合并进权重(零额外开销),也可以多个适配器按任务热切换。

#关键参数与实践

  • r(秩):越大表达能力越强、显存略增,8-32 对多数任务足够
  • alpha:缩放系数,常设为 r 的 1-2 倍
  • 目标层:通常注入注意力的 q/k/v/o 投影
  • 数据量:几百到几千条高质量样本即可见效,远少于全参微调

本页目录

  • #原理一句话
  • #关键参数与实践

更新于 2026-10-02

#关于「LoRA(低秩适配微调)」的常见问题

LoRA 冻结原模型权重,只训练注入各层的低秩矩阵(适配器),训练参数量不到原模型 1%,显存约为推理的 1.2 倍,是个人微调的主流方案。

本词条属于微调训练分类,与 、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具