Press⌘+Kto search
LoRA(低秩适配微调)
微调训练LoRA 冻结原模型权重,只训练注入各层的低秩矩阵(适配器),训练参数量不到原模型 1%,显存约为推理的 1.2 倍,是个人微调的主流方案。
#原理一句话
研究发现微调引起的权重变化是低秩的:用一个秩 r(常取 8-64)的低秩分解 A×B 来表示"改动量",只训练 A 和 B。原权重不动,推理时可以把适配器合并进权重(零额外开销),也可以多个适配器按任务热切换。
#关键参数与实践
- r(秩):越大表达能力越强、显存略增,8-32 对多数任务足够
- alpha:缩放系数,常设为 r 的 1-2 倍
- 目标层:通常注入注意力的 q/k/v/o 投影
- 数据量:几百到几千条高质量样本即可见效,远少于全参微调
本页目录
- #原理一句话
- #关键参数与实践
更新于 2026-10-02
#关于「LoRA(低秩适配微调)」的常见问题
LoRA 冻结原模型权重,只训练注入各层的低秩矩阵(适配器),训练参数量不到原模型 1%,显存约为推理的 1.2 倍,是个人微调的主流方案。
本词条属于微调训练分类,与 、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。