Press⌘+Kto search
推理速度(Token/s)
基础概念推理速度指模型每秒生成的 Token 数,是衡量本地部署体验的核心指标。它主要受内存带宽而非算力峰值的限制。
#为什么带宽比算力重要
自回归模型每生成一个 Token,都要把全部权重从显存过一遍。以 7B Q4 模型为例,约 4GB 权重,显存带宽 300GB/s 的显卡理论上限约 75 Token/s,实际打对折到 30-40。这就是为什么苹果统一内存机器跑模型不慢——带宽高;而老显卡算力够但带宽低,速度上不去。
#提速的常见手段
- 更激进的量化(Q4 比 Q8 快约 30-50%,因为搬运的数据更少)
- 批处理(batch):多请求并行提高吞吐,但单条延迟上升
- Flash Attention、 speculative decoding 等算法优化
- 确认上下文长度没被设得过大——KV Cache 过大也会拖慢速度
配套工具
理解了概念,用工具直接上手验证
本页目录
- #为什么带宽比算力重要
- #提速的常见手段
更新于 2026-10-02
#关于「推理速度(Token/s)」的常见问题
推理速度指模型每秒生成的 Token 数,是衡量本地部署体验的核心指标。它主要受内存带宽而非算力峰值的限制。
本词条属于基础概念分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。