推理速度(Token/s)

基础概念

推理速度指模型每秒生成的 Token 数,是衡量本地部署体验的核心指标。它主要受内存带宽而非算力峰值的限制。

#为什么带宽比算力重要

自回归模型每生成一个 Token,都要把全部权重从显存过一遍。以 7B Q4 模型为例,约 4GB 权重,显存带宽 300GB/s 的显卡理论上限约 75 Token/s,实际打对折到 30-40。这就是为什么苹果统一内存机器跑模型不慢——带宽高;而老显卡算力够但带宽低,速度上不去。

#提速的常见手段

  • 更激进的量化(Q4 比 Q8 快约 30-50%,因为搬运的数据更少)
  • 批处理(batch):多请求并行提高吞吐,但单条延迟上升
  • Flash Attention、 speculative decoding 等算法优化
  • 确认上下文长度没被设得过大——KV Cache 过大也会拖慢速度

#关于「推理速度(Token/s)」的常见问题

推理速度指模型每秒生成的 Token 数,是衡量本地部署体验的核心指标。它主要受内存带宽而非算力峰值的限制。

本词条属于基础概念分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具