Press⌘+Kto search
LoRA微调显存计算器
估算全参 / LoRA / QLoRA 微调所需显存,推荐合适的显卡配置
选择基础模型、微调方式、批大小与序列长度,按「权重 + 优化器 + 激活值 + 框架开销」估算训练显存,并给出可运行的显卡建议。公式与系数透明可查,结果为工程估算值,实际以框架日志为准。
训练配置
32 层 · 隐藏维度 4,096
冻结权重训练低秩适配器,显存约为推理的 1.2 倍
显存账单
17.6 GB
估算训练显存
24GB
建议显卡(留 25% 余量)
可行
单卡 24GB 评估
权重 + 优化器
15.6 GB
激活值
0.4 GB
输出层 logits 峰值
0.1 GB
框架/上下文开销
1.5 GB
按 7B 参数、批 1、序列 1024、梯度检查点开启 估算。 LoRA 显存 ≈ 参数量×2.4字节 + 激活值,适配器秩 r=8~64 的影响可忽略。
常见显卡能否跑得动
RTX 4060
8GB 显存 · 不足
RTX 4070
12GB 显存 · 不足
RTX 4080
16GB 显存 · 不足
RTX 4090
24GB 显存
A6000 / L40S
48GB 显存
A100 / H100
80GB 显存
消费级单卡跑不下时,可组合:QLoRA 降批大小 / 多卡张量并行 / 云端租卡(A100 80G 单卡可全参微调 13B)。
#关于微调显存估算
微调显存由四部分组成:模型权重、优化器状态、激活值和框架开销。三种主流方式差别巨大——全参微调每个参数约需 16 字节(FP16 权重 2B + 梯度 2B + Adam 状态 8B + FP32 主权重 4B),因此 7B 模型全参微调需要约 112GB 以上;LoRA 冻结基础权重只训练低秩适配器,FP16 权重 2B/参数即可起步;QLoRA 把基础权重量化到 4-bit,约 0.6B/参数,24GB 消费卡就能微调 33B 模型。
省显存的工程手段
- 梯度检查点:重算换显存,激活值降至 1/4 左右
- 梯度累积:小批多次累积等效大批,激活值只按小批算
- 8-bit 优化器:Adam 状态减半(paged_adamw_8bit)
- NEFTune / Unsloth / Liger Kernel:算子级优化进一步压缩
常见问题
- 估算和实际训练差多少?±20% 以内。实际显存受框架版本、是否 flash-attention、词表大小(logits 峰值)影响,务必留出余量。
- 为什么大词表模型(如 Qwen)显存更高?输出 logits 层为 [batch×seq, vocab] 的 FP32 张量,词表 15 万时峰值可达数 GB,本工具已折算进框架开销。
相关工具推荐
Spine动画编辑器
专业的Spine动画预览和编辑工具,支持多引擎导出
热门 新品 本地
SQL查询优化器
分析SQL查询并提供优化建议
热门 新品 本地
JVM启动参数配置
可视化配置Java虚拟机启动参数,支持内存、GC、性能等选项
热门 新品 本地
代码片段转换
不同编程语言间代码片段转换(如Python↔JavaScript)
热门 新品 本地
IP地址查询
查询IP地址的地理位置、运营商、ASN等信息,支持IPv4和IPv6
热门 新品 本地
JSON转TypeScript接口
根据JSON数据自动生成TypeScript类型定义
热门 新品 本地