7B / 14B / 32B 模型需要什么显卡:显存计算公式与速查表
“7B 模型只要 7GB 显存吗”
不是。模型页标注的 7B、14B、32B 是参数量,不是显存占用,而显存算不清的后果很直接:轻则模型溢出到内存、速度暴跌,重则直接 OOM 报错。这篇文章把显存账拆成三部分,给出一个够用的公式和一张速查表——买卡或拉模型之前,先对一遍。
先把结论放在前面:参数量决定权重大小,量化档位决定权重能压到多小,上下文长度决定弹性部分有多大。看完这篇,你可以自己估算任何"参数量 + 量化 + 上下文"组合的显存需求,而不是到处搜"XX 显卡能不能跑 XX 模型"。
显存里装了三样东西
- 模型权重:绝对大头,体积由参数量 × 量化档位决定
- KV Cache:推理时缓存的历史计算结果,随上下文长度线性增长,是长对话爆显存的元凶(机制见 KV Cache 词条)
- 运行开销:框架缓冲区、激活值、CUDA 上下文等,约 1-2GB,跑什么模型都省不掉
三部分的占比因场景而异:短对话跑小模型时,权重占九成以上;长文档分析时,KV Cache 可以反超权重——同一个模型,上下文从 8K 拉到 64K,总占用翻倍很正常。这也是"7B 只要 7GB"一类说法失真的主要来源。
显存(VRAM)本身的基础概念不在这里展开,显存词条有通俗版本。
一个够用的公式与速查表
权重体积有一个估算公式:权重 GB ≈ 参数量(B)× 每参数字节数。Q4_K_M 约每参数 0.6 字节,Q6_K 约 0.8,Q8_0 约 1.0。据此算出主流参数量的权重体积:
| 参数量 | Q4_K_M | Q6_K | Q8_0 |
|---|---|---|---|
| 7B | 4.2 GB | 5.6 GB | 7.4 GB |
| 14B | 8.4 GB | 11.2 GB | 14.8 GB |
| 32B | 19.2 GB | 25.6 GB | 33.9 GB |
| 70B | 42 GB | 56 GB | 74 GB |
KV Cache 有个估算公式:每 Token 字节数 ≈ 2 × 层数 × KV 头数 × 头维度 × 每参数字节数。不想推导可以直接记结论:主流 8B 级模型在 FP16 下约 0.12MB/Token,70B 级约 0.3MB/Token;把 KV Cache 也量化到 Q8,还能省下一半。
实际占用要在权重表基础上再加 1-2GB 运行开销和 KV Cache:以 8B 级模型为例,FP16 精度的 KV Cache 约 0.12MB/Token,8K 上下文约 1GB,拉到 32K 就是 4GB;70B 级模型同样 8K 上下文,KV Cache 还要翻一倍以上。经验法则是:权重不超过总显存的 70-80%,剩下的留给 KV Cache 和运行开销。
拿 12G 显卡跑 14B Q4_K_M 完整算一遍:权重 8.4GB + 8K 上下文的 KV Cache 约 1.3GB + 运行开销约 1.5GB ≈ 11.2GB,占掉九成以上——能跑,但上下文再拉长就悬。同样的账放到 16G 卡上只占七成,从容得多。“能不能跑"和"跑得舒服"之间,隔的就是这 20-30% 的余量。
显卡对号入座
把公式套到常见显卡上:
- 8G(RTX 4060 等):7B Q4/Q6 流畅;7B Q8 已到极限,必须压上下文;14B 及以上基本无缘
- 12G(RTX 4070 等):14B Q4 舒适;7B Q8 无压力
- 16G(RTX 4080 等):14B Q6/Q8 流畅;32B Q3 需部分卸载到内存,速度明显下降
- 24G(RTX 3090 / 4090):32B Q4 的主力档位;70B 即使压到 Q2 也不建议
- 48G+(RTX 6000 Ada / A6000,或双 24G):70B Q4 舒适
笔记本显卡要再收紧一档:同型号移动版功耗墙更低,显存还常被屏幕输出占掉几百 MB,建议按"减 1GB"规划。
懒得手算,直接用 GPU 检测与模型推荐工具:识别显卡型号后,它会按实际可用显存把这份账单自动算好,输出能跑的模型与量化档位清单。
苹果统一内存的特例
Mac 没有独立显存,CPU 与 GPU 共享统一内存,但 macOS 默认只允许 GPU 使用约 70% 的内存——这就是"70% 规则”(原理见统一内存词条):
| 机器内存 | 模型可用上限 |
|---|---|
| 8GB | 约 5.6GB |
| 16GB | 约 11GB |
| 32GB | 约 22GB |
| 64GB | 约 45GB |
| 128GB | 约 90GB |
对照速查表:16GB Mac 跑 14B Q4 没问题;128GB 的 Mac Studio 可以挑战 70B Q4 甚至 MoE 大模型。Mac 上跑 MoE 还很占便宜:显存按总参数算、速度按激活参数算,32GB 机型(可用约 22GB)装下 Qwen3-30B-A3B 的 Q4 版本(约 18GB)后,还能跑出接近 3B 模型的速度。
常见问题
为什么实际占用总比表里高
三个原因叠加:实际上下文比你以为的长(KV Cache 随之膨胀)、系统和其他进程保留了一部分显存、运行开销被低估。举个数:8B 模型开 32K 上下文,光 KV Cache 就要 4GB,加上 8.4GB 的 Q4 权重和开销,12G 显存就见底了——表格里的"8.4GB"没骗你,是上下文在加价。想精确预估,先用 Token 计数与 API 成本计算器估出典型会话的真实 Token 量,再按 0.12MB/Token 折算 KV Cache。
显存差一点,怎么降级最划算
按这个顺序试:降量化档(Q6→Q4)→ 缩短上下文 → 换更小参数模型 → CPU 卸载。前两步几乎无损——这也是降量化排在第一步的原因;最后一步速度会掉一个数量级,只做救急用。
训练显存怎么算
微调的显存需求通常是推理的数倍——梯度和优化器状态都要占显存。好消息是 LoRA/QLoRA 把门槛大幅拉低:8B 模型的 QLoRA 微调,24G 卡就能做。具体数字用 LoRA 微调显存计算器按模型与批次设置估算,它还会顺手推荐合适的显卡。提醒一句:推理和训练别用同一张表,先按推理档位选卡,再按训练需求加预算。
小结
显存账就三笔:权重看参数量与量化、KV Cache 看上下文长度、再加 1-2GB 开销,算完记得留 20-30% 余量。所有工具收录在本地跑大模型场景专题里;显卡到位后装哪个模型,见三大模型家族选型指南,部署实操可以参考16G Mac 部署实录。