Press⌘+Kto search
显存(VRAM)
模型与量化显存是显卡板载的高速内存,跑本地大模型的第一约束条件:模型权重、KV Cache、运行开销全都要装进去,装不下就只能分层卸载或换更小的量化。
#显存里装了什么
推理时显存 = 模型权重(Q4 下约 0.6GB/1B 参数)+ KV Cache(随上下文线性增长)+ 运行时开销(约 1GB)。训练的构成完全不同:还要加梯度和优化器状态,全参微调约 16GB/1B 参数,这是训练比推理贵一个数量级的原因。
#容量与带宽要一起看
选卡不要只看显存大小:生成速度主要由显存带宽决定。同样是 24GB,消费卡(4090,约 1TB/s)与专业卡的实际推理速度差距远小于价格差距。苹果统一内存则是另一条路线——容量大、带宽高,但受 macOS 有线内存比例限制。
配套工具
理解了概念,用工具直接上手验证
本页目录
- #显存里装了什么
- #容量与带宽要一起看
更新于 2026-10-02
#关于「显存(VRAM)」的常见问题
显存是显卡板载的高速内存,跑本地大模型的第一约束条件:模型权重、KV Cache、运行开销全都要装进去,装不下就只能分层卸载或换更小的量化。
本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。