Embedding(向量化)

推理与部署

Embedding 模型把文本映射为高维向量,语义相近的文本向量距离也相近——它是语义搜索、RAG、聚类推荐的底层组件。

#和生成模型的区别

生成模型输出文字,Embedding 模型输出一个固定长度的浮点数组(如 1024 维)。它不"说话",只负责把语义变成可计算的几何关系:余弦相似度高的两段文本,语义大概率相近。模型体积普遍很小(0.1-1GB 级),本地跑毫无压力。

#选型要点

  • 中文场景:bge-m3、bge-large-zh 是社区常用选择
  • 看两个指标:MTEB 榜单得分(质量)与向量维度(存储成本)
  • 同库向量必须用同一模型生成,换模型要全量重嵌入
  • Embedding 模型输出 ≠ 生成模型输出,两者在 RAG 中是上下游关系

本页目录

  • #和生成模型的区别
  • #选型要点

更新于 2026-10-02

#关于「Embedding(向量化)」的常见问题

Embedding 模型把文本映射为高维向量,语义相近的文本向量距离也相近——它是语义搜索、RAG、聚类推荐的底层组件。

本词条属于推理与部署分类,与 其他基础概念 等概念紧密相关。如果你刚开始接触本地大模型部署,建议按「基础概念 → 模型与量化 → 推理与部署」的顺序阅读相关词条,配合 GPU 检测工具 边学边验证自己硬件的可行方案。

相关工具推荐

暂无相关工具推荐

您可以浏览更多分类发现其他实用工具