Press⌘+Kto search
RAG(检索增强生成)
推理与部署RAG 先从知识库检索相关资料、再让模型基于资料回答,用外部知识弥补模型训练数据的时效与私有性缺口,同时显著降低幻觉。
#标准流程
离线阶段:文档切块(chunk)→ 用 Embedding 模型转向量 → 存入向量数据库。在线阶段:用户问题同样转向量 → 检索最相近的若干块 → 作为上下文拼进提示词 → 模型基于给定材料作答。模型的角色从"回忆知识"变成"阅读理解",这正是它擅长的。
#效果好坏的关键
- 切块策略:按语义边界切,块大小 300-800 字为主流
- Embedding 模型质量:中文场景 bge 系列是常用选择
- 检索方式:向量检索 + 关键词检索混合(hybrid)效果更稳
- 提示词要求"仅根据给定资料回答,标注引用",进一步压幻觉
本页目录
- #标准流程
- #效果好坏的关键
更新于 2026-10-02
#关于「RAG(检索增强生成)」的常见问题
RAG 先从知识库检索相关资料、再让模型基于资料回答,用外部知识弥补模型训练数据的时效与私有性缺口,同时显著降低幻觉。
本词条属于推理与部署分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。