RAG 检索为空时如何阻止模型编造:证据门槛、引用绑定与拒答回退
RAG 知识库上线后,最让人不放心的场景不是检索接口报错,而是检索返回几段看似相关的文字,模型就开始用肯定语气补全没有证据的结论。尤其是内部制度、价格、权限和版本规则,答错一次往往比直接说“不知道”更麻烦。稳定的做法是把证据门槛放在生成前,把引用绑定放在生成后,证据不够就明确回退。
- 检索命中不代表证据足够,至少要同时检查分数、来源有效期和问题覆盖范围。
- 生成提示词要求引用还不够,服务端要校验每个关键结论是否绑定了实际片段。
- 检索为空、证据冲突或低于阈值时,统一进入拒答、追问或人工转接,不要继续自由生成。
- 评估 RAG 质量时要单独统计“无证据却回答”的比例,不能只看文本是否通顺。
先复现一次“知识库没答案,模型却答得很像真的”
假设用户问:“试用期员工能不能申请本季度的远程办公补贴?”检索器返回了两段旧制度:一段讲正式员工,另一段讲去年已经失效的补贴规则。若只把 top-k 文本拼进提示词,模型很可能把“正式员工”和“试用期”混在一起,再给出一个完整但未经支持的结论。
排查日志时先看三个值:hit_count、最高相似度 top_score、来源的 effective_to。如果命中数为 0,或者最高分低于业务阈值,生成环节根本不应该启动。命中数大于 0 也不能直接放行,过期文档和只覆盖半个问题的片段同样属于无效证据。

把“相关”拆成三道可检查的门
一个实用的证据门可以先从三项开始,不必一上来就做复杂的评估模型。
| 检查项 | 示例规则 | 失败后的处理 |
|---|---|---|
| 命中数量 | hit_count >= 1 | 无结果时拒答或追问关键词 |
| 相似度 | top_score >= 0.78 | 低于阈值时不进入生成 |
| 时效与范围 | 文档有效且覆盖问题实体 | 过滤过期或范围不符的片段 |
阈值不能照抄别人的数字。不同 embedding 模型、切片长度和业务语料会改变分数分布。可以从一批人工标注的问题开始,分别观察“有答案”和“无答案”的分数区间,再选一个宁可多回退、不要放过明显无证据问题的初始值。
type Evidence struct {
Text string
Score float64
SourceID string
EffectiveTo time.Time
Covers []string
}
func passEvidence(question string, hits []Evidence, now time.Time) bool {
if len(hits) == 0 || hits[0].Score
这里的 coversQuestion 不一定要做成另一个大模型判断器,第一版可以用文档元数据里的产品名、地区、角色、时间范围等字段做硬过滤。先把明显不适用的片段排掉,通常比继续堆更多候选文本更有效。
生成前先决定:回答、追问,还是拒答
证据门通过后才调用模型,并且把“只能依据证据回答”写成清楚的输入约束。门没通过时,服务端直接返回结构化结果,前端再决定显示提示、请求用户补充条件,还是转人工。
{
"status": "needs_more_context",
"answer": "当前知识库没有覆盖“试用期员工”这一条件,无法确认补贴资格。",
"citations": [],
"next_question": "你想查询的是哪一地区、哪一版制度?"
}
拒答不是把所有不确定问题都挡掉。可把结果分成三类:证据充分时正常回答;证据部分覆盖时先追问缺失条件;完全没有依据时给出可解释的拒答。这样用户看到的是下一步,而不是一句冷冰冰的“无法回答”。
答案句和引用要一一对得上
提示词里写“请附引用”只能改变模型的表达,不能证明引用真的支持结论。更稳的返回结构是让模型为每个事实句带上 source_id,服务端检查这个 ID 是否来自本次检索结果,并确认引用片段确实包含相关实体或条件。
{
"claims": [
{
"text": "正式员工可以申请该补贴。",
"source_ids": ["policy-2026-03"]
}
],
"answer": "该制度只明确覆盖正式员工,试用期员工是否适用需要向人事确认。",
"status": "partially_supported"
}
如果模型返回了不在白名单里的 source_id,或者关键句的引用为空,就把结果降级为待核对。不要为了让页面看起来完整而自动补一个“最相近”的来源,这会制造比无引用更难发现的错觉。

冲突证据要显式处理,不能让模型自行投票
同一问题命中两版制度时,最高分片段未必是最新版本。建议在入库时给文档补充版本号、生效时间、适用部门和地域;检索阶段先按这些字段过滤,再按语义分数排序。
- 同一
source_key有多个版本:优先选择生效中的版本。 - 两份有效制度互相矛盾:回答“存在冲突”,并列出来源交给人工确认。
- 来源已过期但没有替代版本:拒答并提示查找最新制度入口。
- 用户问题缺少地区或角色:先追问,不用默认值猜测。
这一步看起来不如调 prompt 有趣,但它处理的是业务事实的生命周期。RAG 的“知识”不是永久不变的文本,版本和适用范围没有进入检索条件,生成模型只能替你掩盖数据管理问题。
用四组指标判断回退策略有没有帮上忙
上线后建议按周抽样看四个指标:有证据回答率、无证据拒答率、引用覆盖率、人工纠正率。最重要的不是拒答越少越好,而是“没有证据却给出肯定回答”的比例持续下降。
- 构造一批知识库明确没有答案的问题,确认系统会拒答或追问。
- 为同一制度准备新旧版本,确认过期版本不会压过当前版本。
- 随机删除一个引用片段,确认引用校验能把答案标成待核对。
- 让两个来源给出冲突条件,确认页面展示冲突,而不是合成一个新结论。
相关问题
相似度阈值设得越高越安全吗?
不一定。阈值过高会把本来有答案的问题全部挡掉,关键是用真实标注集观察误放行和误拒答的代价,再按业务风险分层设置。
只返回检索原文是不是就不会编造?
能减少生成环节的风险,但用户仍需要可读答案。更稳的是原文、结论和引用一起返回,并让服务端校验结论与来源关系。
什么时候应该转人工?
涉及权限、金额、合规、医疗或两份有效制度冲突时,建议提供人工入口。模型可以整理已找到的证据,但不应替代最终裁定。
结构化输出能解决 RAG 幻觉吗?
它主要约束字段和格式,不能证明字段内容有证据。即使 JSON 完全合法,也要独立检查引用、时效和问题覆盖。
把“回答得像真的”改成“证据足够才回答”
RAG 的可靠性不只取决于召回模型,也取决于什么时候允许生成、答案如何绑定来源、证据冲突时谁来做决定。先建立命中数、分数、有效期和覆盖范围这几道门,再把拒答和人工回退做成正常产品路径,知识库才不会把不确定性包装成确定答案。
Go 配置热加载怎么选:atomic.Value、RWMutex 与 channel 归属的实战取舍
- 上一篇
- Go 配置热加载怎么选:atomic.Value、RWMutex 与 channel 归属的实战取舍
- 下一篇
- Python sqlite3 事务为什么没回滚:autocommit、with connect 和显式 rollback 的边界
-
- 科技周边 · 人工智能 | 1小时前 | rag · 检索增强生成 · 文档切分 · 引用溯源 · 人工智能工程 · chunk overlap chunk_id RAG切块配置 RAG引用定位 offset mapping
- RAG 切块与引用定位怎么配置或排查
- 404浏览 收藏
-
- 科技周边 · 人工智能 | 2小时前 |
- 检索结果重复时如何做去重和来源合并
- 484浏览 收藏
-
- 科技周边 · 人工智能 | 3小时前 |
- AI 生成代码如何用单元测试约束修改范围
- 366浏览 收藏
-
- 科技周边 · 人工智能 | 4小时前 |
- 提示词模板如何给变量设置默认值和类型
- 296浏览 收藏
-
- 科技周边 · 人工智能 | 6小时前 |
- 流式输出中断后如何恢复未完成的模型响应
- 108浏览 收藏
-
- 科技周边 · 人工智能 | 7小时前 | 上下文 · 人工智能 · ai agent · rag · AI Agent agent memory 记忆系统
- AI Agent 记忆如何区分用户事实和临时对话
- 110浏览 收藏
-
- 科技周边 · 人工智能 | 14小时前 | API · 错误处理 · 人工智能 · 工程实践 · 函数调用 · 参数校验 工具调用 Function Calling 幂等重试 strict Schema
- 工具调用参数校验失败后怎样安全重试
- 215浏览 收藏
-
- 科技周边 · 人工智能 | 15小时前 | API · 人工智能 · json schema · 结构化输出 · 排错 · enum 结构化输出 JSON Schema 模型API 响应校验
- 结构化输出如何处理模型返回的枚举值错误
- 345浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 110次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 24次使用
-
- OpenCompass
- OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
- 44次使用
-
- AGI-Eval
- AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
- 23次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 264次使用
-
- Go 1.25 testing.Attr 实战:别让 CI 测试报告只剩一堆失败日志
- 2026-06-02 478浏览
-
- Go 令牌桶限流实战:用 time.Ticker 保护高频接口
- 2026-06-13 484浏览
-
- Go 结构化日志库怎么选:标准库 slog、zap 与 zerolog 的取舍
- 2026-07-22 151浏览
-
- Go 1.26 的 go fix 怎么安全改造旧项目:从扫描到回归验证
- 2026-07-24 396浏览
-
- Go netip 怎么做 CIDR 白名单:解析、匹配与失败回归
- 2026-07-24 167浏览

