“7B 模型只要 7GB 显存吗”

不是。模型页标注的 7B、14B、32B 是参数量,不是显存占用,而显存算不清的后果很直接:轻则模型溢出到内存、速度暴跌,重则直接 OOM 报错。这篇文章把显存账拆成三部分,给出一个够用的公式和一张速查表——买卡或拉模型之前,先对一遍。

先把结论放在前面:参数量决定权重大小,量化档位决定权重能压到多小,上下文长度决定弹性部分有多大。看完这篇,你可以自己估算任何"参数量 + 量化 + 上下文"组合的显存需求,而不是到处搜"XX 显卡能不能跑 XX 模型"。

显存里装了三样东西

  1. 模型权重:绝对大头,体积由参数量 × 量化档位决定
  2. KV Cache:推理时缓存的历史计算结果,随上下文长度线性增长,是长对话爆显存的元凶(机制见 KV Cache 词条)
  3. 运行开销:框架缓冲区、激活值、CUDA 上下文等,约 1-2GB,跑什么模型都省不掉

三部分的占比因场景而异:短对话跑小模型时,权重占九成以上;长文档分析时,KV Cache 可以反超权重——同一个模型,上下文从 8K 拉到 64K,总占用翻倍很正常。这也是"7B 只要 7GB"一类说法失真的主要来源。

显存(VRAM)本身的基础概念不在这里展开,显存词条有通俗版本。

一个够用的公式与速查表

权重体积有一个估算公式:权重 GB ≈ 参数量(B)× 每参数字节数。Q4_K_M 约每参数 0.6 字节,Q6_K 约 0.8,Q8_0 约 1.0。据此算出主流参数量的权重体积:

参数量Q4_K_MQ6_KQ8_0
7B4.2 GB5.6 GB7.4 GB
14B8.4 GB11.2 GB14.8 GB
32B19.2 GB25.6 GB33.9 GB
70B42 GB56 GB74 GB

KV Cache 有个估算公式:每 Token 字节数 ≈ 2 × 层数 × KV 头数 × 头维度 × 每参数字节数。不想推导可以直接记结论:主流 8B 级模型在 FP16 下约 0.12MB/Token,70B 级约 0.3MB/Token;把 KV Cache 也量化到 Q8,还能省下一半。

实际占用要在权重表基础上再加 1-2GB 运行开销和 KV Cache:以 8B 级模型为例,FP16 精度的 KV Cache 约 0.12MB/Token,8K 上下文约 1GB,拉到 32K 就是 4GB;70B 级模型同样 8K 上下文,KV Cache 还要翻一倍以上。经验法则是:权重不超过总显存的 70-80%,剩下的留给 KV Cache 和运行开销。

拿 12G 显卡跑 14B Q4_K_M 完整算一遍:权重 8.4GB + 8K 上下文的 KV Cache 约 1.3GB + 运行开销约 1.5GB ≈ 11.2GB,占掉九成以上——能跑,但上下文再拉长就悬。同样的账放到 16G 卡上只占七成,从容得多。“能不能跑"和"跑得舒服"之间,隔的就是这 20-30% 的余量。

显卡对号入座

把公式套到常见显卡上:

  • 8G(RTX 4060 等):7B Q4/Q6 流畅;7B Q8 已到极限,必须压上下文;14B 及以上基本无缘
  • 12G(RTX 4070 等):14B Q4 舒适;7B Q8 无压力
  • 16G(RTX 4080 等):14B Q6/Q8 流畅;32B Q3 需部分卸载到内存,速度明显下降
  • 24G(RTX 3090 / 4090):32B Q4 的主力档位;70B 即使压到 Q2 也不建议
  • 48G+(RTX 6000 Ada / A6000,或双 24G):70B Q4 舒适

笔记本显卡要再收紧一档:同型号移动版功耗墙更低,显存还常被屏幕输出占掉几百 MB,建议按"减 1GB"规划。

懒得手算,直接用 GPU 检测与模型推荐工具:识别显卡型号后,它会按实际可用显存把这份账单自动算好,输出能跑的模型与量化档位清单。

苹果统一内存的特例

Mac 没有独立显存,CPU 与 GPU 共享统一内存,但 macOS 默认只允许 GPU 使用约 70% 的内存——这就是"70% 规则”(原理见统一内存词条):

机器内存模型可用上限
8GB约 5.6GB
16GB约 11GB
32GB约 22GB
64GB约 45GB
128GB约 90GB

对照速查表:16GB Mac 跑 14B Q4 没问题;128GB 的 Mac Studio 可以挑战 70B Q4 甚至 MoE 大模型。Mac 上跑 MoE 还很占便宜:显存按总参数算、速度按激活参数算,32GB 机型(可用约 22GB)装下 Qwen3-30B-A3B 的 Q4 版本(约 18GB)后,还能跑出接近 3B 模型的速度。

常见问题

为什么实际占用总比表里高

三个原因叠加:实际上下文比你以为的长(KV Cache 随之膨胀)、系统和其他进程保留了一部分显存、运行开销被低估。举个数:8B 模型开 32K 上下文,光 KV Cache 就要 4GB,加上 8.4GB 的 Q4 权重和开销,12G 显存就见底了——表格里的"8.4GB"没骗你,是上下文在加价。想精确预估,先用 Token 计数与 API 成本计算器估出典型会话的真实 Token 量,再按 0.12MB/Token 折算 KV Cache。

显存差一点,怎么降级最划算

按这个顺序试:降量化档(Q6→Q4)→ 缩短上下文 → 换更小参数模型 → CPU 卸载。前两步几乎无损——这也是降量化排在第一步的原因;最后一步速度会掉一个数量级,只做救急用。

训练显存怎么算

微调的显存需求通常是推理的数倍——梯度和优化器状态都要占显存。好消息是 LoRA/QLoRA 把门槛大幅拉低:8B 模型的 QLoRA 微调,24G 卡就能做。具体数字用 LoRA 微调显存计算器按模型与批次设置估算,它还会顺手推荐合适的显卡。提醒一句:推理和训练别用同一张表,先按推理档位选卡,再按训练需求加预算。

小结

显存账就三笔:权重看参数量与量化、KV Cache 看上下文长度、再加 1-2GB 开销,算完记得留 20-30% 余量。所有工具收录在本地跑大模型场景专题里;显卡到位后装哪个模型,见三大模型家族选型指南,部署实操可以参考16G Mac 部署实录。