LoRA微调显存计算器

估算全参 / LoRA / QLoRA 微调所需显存,推荐合适的显卡配置

选择基础模型、微调方式、批大小与序列长度,按「权重 + 优化器 + 激活值 + 框架开销」估算训练显存,并给出可运行的显卡建议。公式与系数透明可查,结果为工程估算值,实际以框架日志为准。

训练配置

32 层 · 隐藏维度 4,096

冻结权重训练低秩适配器,显存约为推理的 1.2 倍

显存账单

17.6 GB

估算训练显存

24GB

建议显卡(留 25% 余量)

可行

单卡 24GB 评估

权重 + 优化器
15.6 GB
激活值
0.4 GB
输出层 logits 峰值
0.1 GB
框架/上下文开销
1.5 GB
按 7B 参数、批 1、序列 1024、梯度检查点开启 估算。 LoRA 显存 ≈ 参数量×2.4字节 + 激活值,适配器秩 r=8~64 的影响可忽略。

常见显卡能否跑得动

RTX 4060

8GB 显存 · 不足

RTX 4070

12GB 显存 · 不足

RTX 4080

16GB 显存 · 不足

RTX 4090

24GB 显存

A6000 / L40S

48GB 显存

A100 / H100

80GB 显存

消费级单卡跑不下时,可组合:QLoRA 降批大小 / 多卡张量并行 / 云端租卡(A100 80G 单卡可全参微调 13B)。

#关于微调显存估算

微调显存由四部分组成:模型权重、优化器状态、激活值和框架开销。三种主流方式差别巨大——全参微调每个参数约需 16 字节(FP16 权重 2B + 梯度 2B + Adam 状态 8B + FP32 主权重 4B),因此 7B 模型全参微调需要约 112GB 以上;LoRA 冻结基础权重只训练低秩适配器,FP16 权重 2B/参数即可起步;QLoRA 把基础权重量化到 4-bit,约 0.6B/参数,24GB 消费卡就能微调 33B 模型。

省显存的工程手段

  • 梯度检查点:重算换显存,激活值降至 1/4 左右
  • 梯度累积:小批多次累积等效大批,激活值只按小批算
  • 8-bit 优化器:Adam 状态减半(paged_adamw_8bit)
  • NEFTune / Unsloth / Liger Kernel:算子级优化进一步压缩

常见问题

  • 估算和实际训练差多少?±20% 以内。实际显存受框架版本、是否 flash-attention、词表大小(logits 峰值)影响,务必留出余量。
  • 为什么大词表模型(如 Qwen)显存更高?输出 logits 层为 [batch×seq, vocab] 的 FP32 张量,词表 15 万时峰值可达数 GB,本工具已折算进框架开销。

相关工具推荐

Spine动画编辑器

专业的Spine动画预览和编辑工具,支持多引擎导出

热门 新品 本地

SQL查询优化器

分析SQL查询并提供优化建议

热门 新品 本地

JVM启动参数配置

可视化配置Java虚拟机启动参数,支持内存、GC、性能等选项

热门 新品 本地

代码片段转换

不同编程语言间代码片段转换(如Python↔JavaScript)

热门 新品 本地

IP地址查询

查询IP地址的地理位置、运营商、ASN等信息,支持IPv4和IPv6

热门 新品 本地

JSON转TypeScript接口

根据JSON数据自动生成TypeScript类型定义

热门 新品 本地