显存(VRAM)

模型与量化

显存是显卡板载的高速内存,跑本地大模型的第一约束条件:模型权重、KV Cache、运行开销全都要装进去,装不下就只能分层卸载或换更小的量化。

#显存里装了什么

推理时显存 = 模型权重(Q4 下约 0.6GB/1B 参数)+ KV Cache(随上下文线性增长)+ 运行时开销(约 1GB)。训练的构成完全不同:还要加梯度和优化器状态,全参微调约 16GB/1B 参数,这是训练比推理贵一个数量级的原因。

#容量与带宽要一起看

选卡不要只看显存大小:生成速度主要由显存带宽决定。同样是 24GB,消费卡(4090,约 1TB/s)与专业卡的实际推理速度差距远小于价格差距。苹果统一内存则是另一条路线——容量大、带宽高,但受 macOS 有线内存比例限制。

#关于「显存(VRAM)」的常见问题

显存是显卡板载的高速内存,跑本地大模型的第一约束条件:模型权重、KV Cache、运行开销全都要装进去,装不下就只能分层卸载或换更小的量化。

本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具