GGUF 格式

模型与量化

GGUF 是 llama.cpp 生态定义的单文件模型格式,把权重、分词器、元信息打包在一个文件里,是 Ollama、LM Studio 等本地工具的标准载体。

#它解决了什么

GGUF 的前身 GGML 因难以扩展被淘汰。GGUF 在文件头写入架构、超参数、分词器等信息,加载时无需外部配置;支持按需 mmap 加载(权重留在磁盘按需读入内存,启动快);并对 CPU/GPU 混合推理做了优化。

#文件名怎么读

典型文件名如 qwen3-8b-q4_k_m.gguf:前段是模型名与参数量,末段是量化等级。同一模型通常有 Q3/Q4/Q5/Q6/Q8 等多个 GGUF 文件,体积与质量随量化位数上升。Hugging Face 上搜索"模型名 + gguf"即可找到社区量化版本。

本页目录

  • #它解决了什么
  • #文件名怎么读

更新于 2026-10-02

#关于「GGUF 格式」的常见问题

GGUF 是 llama.cpp 生态定义的单文件模型格式,把权重、分词器、元信息打包在一个文件里,是 Ollama、LM Studio 等本地工具的标准载体。

本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具