GEOWIKI中文知识图谱检索⌕
首页 / 术语 / Grounding是什么?与RAG、引用、事实正确性和Faithfulness的区别
RAG · VERIFIED

Grounding是什么?与RAG、引用、事实正确性和Faithfulness的区别

grounding vs rag citation factuality faithfulness

别名:暂无登记别名
DIRECT DEFINITION / 直接定义

Grounding通常译为“有据生成”“依据锚定”或“落地到来源”,指让生成式AI的回答以指定、可验证的信息源为依据;Groundedness描述回答中的陈述在多大程度上能由这些来源支持。RAG是一种先检索再生成的常见Grounding技术;引用是把来源展示给用户的呈现机制;事实正确性是回答是否符合现实或标准答案;Faithfulness则强调回答是否忠实于提供的上下文。

直接答案

Grounding通常译为“有据生成”“依据锚定”或“落地到来源”,指让生成式AI的回答以指定、可验证的信息源为依据;Groundedness描述回答中的陈述在多大程度上能由这些来源支持。RAG是一种先检索再生成的常见Grounding技术;引用是把来源展示给用户的呈现机制;事实正确性是回答是否符合现实或标准答案;Faithfulness则强调回答是否忠实于提供的上下文。

它们不能互相替代:系统执行了RAG,不代表最终回答一定有据;回答带有链接,不代表链接支持对应陈述;回答完全忠实于错误文档,仍可能不符合现实;回答事实碰巧正确,也可能没有使用给定来源。

一、核心术语对照

左右滑动查看完整对比 →
术语主要问题需要什么证据常见失败
Grounding回答是否锚定到指定信息源回答、来源与对应关系来源不足时仍扩写
Groundedness陈述能否由来源支持逐条陈述与证据段落推断超出证据边界
RAG系统是否检索并把结果交给生成模型检索日志、上下文、生成记录检索错、重排错、模型忽略
Citation用户能否看到来源指向链接、文档ID、段落映射链接存在但不支持结论
Factuality陈述是否符合现实或参考答案独立真值或权威来源忠于过期资料但事实已变
Faithfulness回答是否忠实于提供上下文回答与上下文的蕴含关系加入上下文未包含的内容

这些词在论文和产品中可能有不同操作定义。评估报告必须写明所用定义、数据和判定规则,不能只给出一个没有说明来源的“Groundedness 92分”。

二、Grounding具体做什么

Google Cloud将Grounding描述为通过连接数据源,把模型回答锚定到可验证信息。数据源可以是Google Search、企业搜索、自有API、数据库或用户提供的文档。系统通常先获得与问题相关的片段,再要求模型依据这些片段生成回答。

Grounding的重点不是“模型知道更多”,而是明确本次回答应依赖哪一组证据。对于产品政策、企业制度和最新文档,这可以缩小回答依据的范围,也便于用户或评估器复核。

三、Groundedness如何理解

Groundedness关注回答相对于给定来源是否有支持。Microsoft的官方说明把grounded response描述为紧密遵循所给信息、避免无根据猜测或虚构;其检测以source information作为grounding source。

例如,来源只写“服务支持PDF”,回答却说“支持最大100MB的PDF”,前半句有据,大小限制无据。即使100MB在其他网页上碰巧正确,它对当前指定来源仍是ungrounded claim,除非系统把那份网页也纳入证据。

四、Grounding与RAG的区别

RAG是实现Grounding的一种架构,但Grounding范围更广。RAG通常包含文档摄取、索引、查询、召回、重排、上下文拼装和生成;Grounding也可以直接使用用户粘贴的合同段落、结构化数据库结果或工具返回值,而不必运行向量检索。

反过来,系统有RAG组件也不保证回答grounded。检索器可能找错文档,模型可能忽略检索片段,或回答包含来源之外的常识补充。因此要分别评估retrieval quality与generation groundedness。

五、Grounding与引用的区别

引用回答的是“证据在哪里”,Grounding回答的是“陈述是否真的由证据支持”。一条链接可能只支持段落中的一部分;链接到网站首页也可能无法定位具体事实。高质量引用应映射到精确陈述和可访问的证据段落。

Google Vertex AI的响应结构把GroundingMetadata用于描述支持回答内容的检索来源,并可以包含网页URI、标题和域名。拥有这类元数据有利于验证,但仍需检查引用范围与回答陈述是否对应,不能把字段存在当作质量通过。

六、Groundedness与事实正确性的区别

事实正确性通常需要独立真值、标准答案或权威来源。Groundedness只判断相对于本次提供的来源是否有依据。如果来源已过期,模型忠实复述会很grounded,却可能不再factually correct。

相反,模型可能凭参数记忆给出正确答案,但指定来源完全没有这条信息。这时事实可能正确,Groundedness却不足。生产评估应同时检查“来源是否正确且新鲜”与“回答是否忠实使用来源”。

七、Groundedness与Faithfulness的关系

在许多RAG评估语境中,Faithfulness与Groundedness非常接近,都检查回答是否能由上下文推出。RAGAS原始论文把检索系统找到相关、聚焦上下文的能力,与生成模型忠实利用这些上下文的能力分开评估。

实际使用时应声明自己的操作定义。例如,可把Faithfulness定义为“回答陈述被检索上下文蕴含的比例”,把Citation Correctness定义为“标注的每个来源是否支持其对应陈述”。不要在同一报表里混用两个名称却采用不同分母。

八、一个回答如何逐条评估

先把回答拆成可验证的原子陈述。例如“产品A于2026年发布,支持PDF和DOCX,免费版上限10个文件”至少包含四个判断:发布时间、PDF支持、DOCX支持、数量上限。

随后为每条陈述标记:完全支持、部分支持、矛盾、来源缺失或不可验证。只有完全支持的陈述进入grounded计数;部分支持不能因“意思差不多”直接判为通过。还要记录支持它的文档ID、版本、段落和检索时间。

九、检索质量与生成质量要分开

如果正确证据从未进入上下文,问题属于召回、权限过滤、切分或重排;如果正确证据已经进入上下文,但回答仍写错,问题属于生成、提示或上下文使用。两类故障需要不同修复。

至少保存以下中间证据:原始问题、查询改写、检索候选、重排结果、最终上下文、模型回答和引用映射。只有最终答案截图无法判断错误发生在哪一层。

十、如何设计Groundedness测试集

测试集应包含明确可回答、证据不足、来源冲突、过期版本、多文档合并、数字与日期、否定陈述和权限受限问题。对不可回答题,正确行为是说明证据不足,而不是为了完成答案进行猜测。

每个问题要保存人工核验的证据集合和允许的答案边界。时间敏感题必须带评估日期与文档版本。若来源发生变化,应建立新版本测试集,而不是悄悄覆盖旧基线。

十一、常用评估指标

  • Context Recall:需要的证据有多少被检索到。
  • Context Precision:排在前面的片段有多少真正相关。
  • Faithfulness或Groundedness:回答陈述有多少被上下文支持。
  • Citation Correctness:引用是否支持对应陈述。
  • Citation Completeness:需要引用的陈述是否都有来源。
  • Answer Relevance:回答是否直接回应问题。
  • Factual Correctness:相对于独立真值是否正确。
  • 这些指标解决不同问题,不应相加成未经验证的“总可信度”。自动评分器也会误判,关键领域需要人工抽样和争议复核。

十二、常见失败模式

  • 检索到主题相关但不含答案的页面。
  • 将搜索摘要当成完整证据,遗漏限定条件。
  • 多个来源冲突时不标版本和日期。
  • 把模型常识混入必须严格依据文档的回答。
  • 一段引用覆盖多个只有部分受支持的陈述。
  • 用首页链接代替具体文档或段落。
  • 来源需要登录,最终用户无法复核。
  • 文档更新后索引仍返回旧版本。
  • 权限过滤失败,引用了用户无权访问的材料。
  • 自动评分高就停止人工核验。

十三、如何改善Grounding

先改善来源:保留作者、发布日期、版本、权限和规范URL,删除重复与过期副本。再改善检索:按问题类型组合关键词与语义检索,使用重排,把冲突版本显式标记出来。

生成阶段要求模型区分来源事实、合理推断和未知项;证据不足时允许拒答。输出阶段将引用绑定到具体陈述。评估阶段对检索、生成和引用分别记录指标,并回放失败样本验证修复。

十四、GEO内容如何应用Grounding思路

面向AI搜索的内容应提供清晰定义、可引用的短答案、稳定标题、作者与更新时间,并把关键结论链接到一手来源。一个页面应明确区分事实、解释和建议,避免用营销语替代可验证陈述。

这不会保证生成式系统引用页面,但会降低系统理解和核验内容的成本。真正的效果仍需通过固定问题集、来源可见性、引用对应率和长期观察验证,不能只看页面是否被抓取。

十六、结论

Grounding是让回答依据指定、可验证来源,Groundedness衡量陈述被这些来源支持的程度。RAG负责取得上下文,引用负责展示来源,Faithfulness检查对上下文的忠实程度,事实正确性则需要独立真值。可靠系统必须把来源质量、检索效果、回答支持度和引用准确性分开验证。

参考资料

Google Cloud:develop generative ai applicationGoogle Cloud · 术语定义与技术背景 · 访问 2026-08-30

Microsoft Learn:content filter groundednessMicrosoft Learn · 术语定义与技术背景 · 访问 2026-08-30

arXiv:2309.15217arXiv · 术语定义与技术背景 · 访问 2026-08-30