技术词条库
用大白话解释开发与技术概念,每个词条都附带可以直接上手的站内工具
覆盖本地大模型、微调训练、量化部署等领域的核心概念:一句话定义 + 原理展开 + 常见误区 + 相关工具。词条与工具相互链接,看完概念就能直接用工具验证。
Token(词元)
Token 是大语言模型处理文本的最小单位,模型按 Token 计数与计费,一个汉字约占 1 个 Token,4 个英文字符约占 1 个 Token。
上下文窗口(Context Window)
上下文窗口是模型单次能处理的 Token 上限,包含系统提示词、全部对话历史和输出。超出窗口的内容对模型来说等于不存在。
系统提示词(System Prompt)
系统提示词是置于对话最前方的指令,定义模型的角色、任务边界与输出格式。它是整个上下文中"性价比最低、也最重要"的一段——每次请求都会重复计费。
温度系数(Temperature)
温度控制模型输出的随机性:值越低输出越确定(适合抽取、分类),值越高输出越发散(适合创意写作)。常用区间 0-1,默认多为 0.7。
幻觉(Hallucination)
幻觉指模型生成看似合理实则错误或虚构内容的现象,根源在于模型本质是基于统计的下一词预测,而不是事实检索。
推理速度(Token/s)
推理速度指模型每秒生成的 Token 数,是衡量本地部署体验的核心指标。它主要受内存带宽而非算力峰值的限制。
GGUF 格式
GGUF 是 llama.cpp 生态定义的单文件模型格式,把权重、分词器、元信息打包在一个文件里,是 Ollama、LM Studio 等本地工具的标准载体。
模型量化(Quantization)
量化是把模型权重从 16-bit 浮点压缩到 8-bit、4-bit 甚至更低精度的技术,体积与显存占用成倍下降,是消费级硬件跑大模型的前提。
Q4_K_M 量化等级
Q4_K_M 是 GGUF 生态最流行的 4-bit 量化档位,约每 1B 参数占 0.6GB,质量与体积的最佳平衡点,也是 Ollama 等工具的默认选择。
KV Cache
KV Cache 是推理时缓存的注意力键值张量,用空间换时间:没有它每生成一个词都要重算全部历史,有了它生成速度才能保持稳定。
混合专家模型(MoE)
MoE 模型把前馈层拆成多个"专家",每个 Token 只激活其中一小部分(如 Qwen3-30B-A3B 只激活 3B),从而用大参数的质量换来接近小模型的推理速度。
显存(VRAM)
显存是显卡板载的高速内存,跑本地大模型的第一约束条件:模型权重、KV Cache、运行开销全都要装进去,装不下就只能分层卸载或换更小的量化。
统一内存(Unified Memory)
苹果 M 系列芯片的 CPU 与 GPU 共享同一块内存,无需在系统内存和显存之间拷贝权重,是大内存 Mac 能跑大模型的结构性原因。
知识蒸馏(Distillation)
知识蒸馏是让小模型学习大模型输出的训练方法:大模型当老师生成高质量样本,小模型在其上训练,以小模型的成本获得接近老师的效果。
LoRA(低秩适配微调)
LoRA 冻结原模型权重,只训练注入各层的低秩矩阵(适配器),训练参数量不到原模型 1%,显存约为推理的 1.2 倍,是个人微调的主流方案。
QLoRA
QLoRA 把基础模型量化到 4-bit 再做 LoRA 训练,显存约 0.9GB/1B 参数,让 24GB 消费级显卡也能微调 32B 模型,是低资源微调的事实标准。
全参微调(Full Fine-tuning)
全参微调更新模型全部权重,效果上限最高,但显存约 16GB/1B 参数——7B 模型就需要 112GB 以上,通常只有多卡或数据中心环境才跑得动。
RAG(检索增强生成)
RAG 先从知识库检索相关资料、再让模型基于资料回答,用外部知识弥补模型训练数据的时效与私有性缺口,同时显著降低幻觉。
Embedding(向量化)
Embedding 模型把文本映射为高维向量,语义相近的文本向量距离也相近——它是语义搜索、RAG、聚类推荐的底层组件。
本地推理引擎(Ollama / llama.cpp / LM Studio)
本地推理引擎负责把 GGUF 等格式的模型高效跑在你的硬件上:llama.cpp 是底层核心,Ollama 和 LM Studio 是它之上的两种典型封装——命令行服务化与图形界面。
#关于本词条库
技术概念的解释散落在各类博客和问答里,质量参差且大多止步于"是什么"。本词条库的每个词条都遵循固定结构:一句话定义、原理展开、可操作的实践建议,以及配套的站内工具——读完"Q4_K_M 是什么",下一步就能用 GPU 检测工具算清自己的显卡能跑哪个模型。
词条持续更新
当前词条聚焦本地大模型生态(基础概念、量化、微调、部署四个方向),网络、文件处理、安全等领域的词条按计划滚动补充。如果你希望优先看到某个概念的词条,欢迎通过页面底部反馈告诉我们。