RAG(检索增强生成)

推理与部署

RAG 先从知识库检索相关资料、再让模型基于资料回答,用外部知识弥补模型训练数据的时效与私有性缺口,同时显著降低幻觉。

#标准流程

离线阶段:文档切块(chunk)→ 用 Embedding 模型转向量 → 存入向量数据库。在线阶段:用户问题同样转向量 → 检索最相近的若干块 → 作为上下文拼进提示词 → 模型基于给定材料作答。模型的角色从"回忆知识"变成"阅读理解",这正是它擅长的。

#效果好坏的关键

  • 切块策略:按语义边界切,块大小 300-800 字为主流
  • Embedding 模型质量:中文场景 bge 系列是常用选择
  • 检索方式:向量检索 + 关键词检索混合(hybrid)效果更稳
  • 提示词要求"仅根据给定资料回答,标注引用",进一步压幻觉

本页目录

  • #标准流程
  • #效果好坏的关键

更新于 2026-10-02

#关于「RAG(检索增强生成)」的常见问题

RAG 先从知识库检索相关资料、再让模型基于资料回答,用外部知识弥补模型训练数据的时效与私有性缺口,同时显著降低幻觉。

本词条属于推理与部署分类,与 、、 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具