Press⌘+Kto search
GGUF 格式
模型与量化GGUF 是 llama.cpp 生态定义的单文件模型格式,把权重、分词器、元信息打包在一个文件里,是 Ollama、LM Studio 等本地工具的标准载体。
#它解决了什么
GGUF 的前身 GGML 因难以扩展被淘汰。GGUF 在文件头写入架构、超参数、分词器等信息,加载时无需外部配置;支持按需 mmap 加载(权重留在磁盘按需读入内存,启动快);并对 CPU/GPU 混合推理做了优化。
#文件名怎么读
典型文件名如 qwen3-8b-q4_k_m.gguf:前段是模型名与参数量,末段是量化等级。同一模型通常有 Q3/Q4/Q5/Q6/Q8 等多个 GGUF 文件,体积与质量随量化位数上升。Hugging Face 上搜索"模型名 + gguf"即可找到社区量化版本。
本页目录
- #它解决了什么
- #文件名怎么读
更新于 2026-10-02
#关于「GGUF 格式」的常见问题
GGUF 是 llama.cpp 生态定义的单文件模型格式,把权重、分词器、元信息打包在一个文件里,是 Ollama、LM Studio 等本地工具的标准载体。
本词条属于模型与量化分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。