GEOWIKI中文知识图谱检索⌕
首页 / 术语 / 嵌入
RAG · 资料核对 2026-08-23

嵌入

Embedding

别名:向量嵌入 / Embedding Vector
DIRECT DEFINITION / 直接定义

嵌入(Embedding)是模型把文本、图像或其他对象映射为固定维度数值向量的表示。向量中的单一维度通常没有可直接命名的含义;相似度只在同一模型、同一处理流程和适当归一化条件下才有可比较性。

输入与输出

输入可以是一句话、一个片段或一张图,输出是长度为 d 的向量 x=(x1,…,xd),d 称为维度。维度更高不自动代表效果更好,它还影响索引内存、传输和相似度计算成本。

余弦相似度与归一化

余弦相似度 cos(x,y)=(x·y)/(|x||y|),分子是点积,分母是两个向量的长度。若向量已做L2归一化,余弦相似度等于点积。比较前必须确认模型文档建议的距离函数,不能把余弦、点积和欧氏距离分数直接混用。

在检索系统中的位置

文档先被切分并生成嵌入,向量与来源元数据写入索引;查询到来时使用同一模型生成查询向量,检索相近候选,再经过过滤或重排。模型升级通常意味着需要重新嵌入全部语料。

简单示例

“如何配置API超时”和“接口请求多久应该失败”词面不同但语义接近,嵌入可能让它们距离较近;“超时价格”含有相同词却任务不同,仍可能产生误召回,因此需要关键词、元数据与重排协同。

模型选择与偏差

选择时要看语言、领域、最大输入长度、维度、许可和评估数据。语义偏差、否定、数字、代码标识和新术语可能表现不稳定;向量接近不等于事实一致或因果关系成立。

评估与版本管理

使用真实查询和相关文档标注计算Recall@K、MRR或NDCG,并按查询类型分组。保存模型名、版本、归一化、切分和索引时间;混合两个模型生成的向量会破坏距离含义。

文本预处理与长度

同一模型下,标题前缀、空白、大小写、截断位置和任务提示都可能改变向量。建立统一预处理函数并保存版本;超长文本应先按文档结构切分,不能静默截掉包含答案的尾部。查询和文档是否需要不同前缀,应遵循模型说明。

更新与迁移问题

切换模型或维度时建立新索引,完成全量重嵌入和验证后再切流,不在同一字段混写新旧向量。文档修改时删除旧片段并更新来源版本;否则检索可能同时返回过期与新内容。

隐私与安全边界

嵌入仍可能编码敏感信息,不能因为它不是可读文本就忽略数据治理。发送给外部模型前检查许可与最小化,向量库按租户和权限过滤,删除请求需覆盖原文、片段、向量和缓存。

生产检查清单

建立嵌入契约:模型与版本、输入前缀、最大长度、截断策略、维度、归一化、距离函数、语言和许可。用真实查询评估数字、否定、缩写、代码、跨语言与领域术语,记录Recall@K和失败样本。索引记录document_id、chunk_id、source_url、模型版本和生成时间;模型升级使用新字段或新索引,全量回填并对照后再切换。权限过滤在返回候选前执行,删除请求覆盖正文、向量、缓存与备份周期。向量相近只代表表示空间中的接近,不能当作事实一致、来源可信或因果证据。

引用与事实边界

嵌入负责表示相似性,不生成出处。检索记录必须保存原文URL、版本和片段位置,回答引用仍要回到可读原文核验;无法回源的向量不能作为公开事实证据。

常见问题

嵌入向量就是关键词吗?

不是,关键词是离散文本项,嵌入是模型生成的连续数值表示。

不同嵌入模型的向量能直接比较吗?

通常不能,它们位于不同表示空间。

参考资料

Sentence-BERTEMNLP / arXiv · 句向量与相似度检索 · 访问 2026-08-30

Attention Is All You NeedNeurIPS · Transformer表示背景 · 访问 2026-08-30