返回技术文章
RAGGRAB-RAG拒答误导证据知识库安全AI幻觉

RAG 会在“没证据”时拒答,却会被假证据骗过:GRAB-RAG 新研究的安全警告

8 月 23 日提交的 GRAB-RAG 预印本用同问题四种上下文测试三种小型冻结模型。显式拒答提示在缺失证据时几乎不回答,但在误导证据下错误回答率达到 41.6%。本文审计实验、限制与生产防线。

妙蛙 GEO 研究团队7 分钟

8 月 23 日提交的 GRAB-RAG 预印本区分了两个经常被混为一谈的问题:检索结果里没有答案,以及检索结果里有一段流畅、相关、却支持错误答案的证据。研究在 Natural Questions 与 HotpotQA 上测试三种 3.8B–8B 冻结模型。加入显式“证据不足就拒答”提示后,模型面对缺失证据时几乎不回答;面对误导证据时,宏平均错误回答率却达到 41.6%。这不能证明前沿模型或所有生产 RAG 都会按同样比例失败,但它清楚说明:检查“信息够不够”的提示词,不等于验证“信息对不对”。

GRAB-RAG 把同一个问题放入四种上下文:五段支持证据、三段支持加两段干扰、五段无答案干扰,以及一段被替换成错误实体的流畅误导证据加四段干扰
GRAB-RAG 把同一个问题放入四种上下文:五段支持证据、三段支持加两段干扰、五段无答案干扰,以及一段被替换成错误实体的流畅误导证据加四段干扰

一、实验为什么值得看

很多 RAG 演示会加入一句规则:“如果上下文没有足够信息,请回答不知道。”它能降低无证据时的胡乱回答,因此很容易被当作安全机制。

GRAB-RAG 的关键改动是保持问题不变,只改变证据状态:

  • Q100:五段支持证据;
  • Q50:三段支持证据加两段高相关干扰;
  • Q0:没有支持证据,只有五段高相关干扰;
  • QC:一段支持错误实体的流畅误导证据,加四段无答案干扰。

这种配对设计比“拿不同问题比较拒答率”更强,因为问题难度没有同时变化。研究还用固定 JSON 输出与约束解码,避免把格式失败误算成推理失败。

测试对象是 Phi-4-mini-instruct、Llama-3.1-8B-Instruct 与 Qwen2.5-7B-Instruct,全部使用量化冻结版本;问题来自英文抽取式问答集。这些限定决定了结果可以支持多宽的结论。

二、最重要的数字不是“会答错”,而是错误怎样发生

显式拒答策略 P1 在缺失上下文 Q0 上的回答率接近 0,但在误导上下文 QC 上的宏平均错误回答率为 41.6%。换句话说,模型能识别“这里没有可用答案”,却经常识别不了“这里有一个看起来完整的假答案”。

研究汇总五种策略在 QC 条件下产生的 2,350 个回答,其中 59.6%直接复述了被植入的错误实体,36.2%生成其他错误,只有 4.3%覆盖回正确答案。这表明问题并不只是随机幻觉:流畅、相关的错误证据会成为具体的错误锚点。

五种策略的安全与覆盖率权衡:无拒答提示的误导上下文错误回答率 58.2%,显式拒答 41.6%,逐步推理 37.8%,两遍冲突检查 13.3%,NLI 检查 14.0%;更安全的策略同时显著增加可靠问题上的错误拒答
五种策略的安全与覆盖率权衡:无拒答提示的误导上下文错误回答率 58.2%,显式拒答 41.6%,逐步推理 37.8%,两遍冲突检查 13.3%,NLI 检查 14.0%;更安全的策略同时显著增加可靠问题上的错误拒答

这与《你的内容在 RAG 的哪一步被淘汰?检索到生成的五道关卡》的五道关卡形成镜像:检索命中并不保证证据正确,进入上下文也不保证生成器会识别冲突。

三、加一轮验证为什么仍没有免费午餐

论文测试了两种两遍策略。

P3 先让模型根据检索上下文回答,再做一次不带上下文的闭卷回答;两者冲突时拒答。它把 QC 错误回答率降到 13.3%,是五种策略中最低的。但代价很大:在可靠 Q100 问题上的错误拒答成本为 49.8%,在仍可回答的 Q50 上为 55.7%。

P4 用 NLI 模型检查检索段落是否和闭卷答案冲突,QC 错误回答率为 14.0%,保留的可靠答案比 P3 多一些。但当模型自身记忆和误导段落恰好支持同一个错误答案时,验证器仍可能放行。

所以,“再问一次模型”不是独立事实核验。两遍调用如果共享同一错误先验,只会得到一致的错误。

四、论文不能证明什么

这是一篇尚未同行评审的单作者预印本,代码和数据截至 8 月 26 日仍标注为将发布。它没有测试 GPT-5.6、Gemini 等前沿闭源模型,也没有覆盖中文、长文生成或真实企业知识库。

误导证据通过实体替换合成。作者对 200 个样本做质量审计时发现 26 个替换存在类别不匹配,占 13%;质量等级由一人标注,没有报告标注者一致性。QC 可构造样本也偏向更容易做实体替换的事实题。

因此,41.6%不能被写成“企业 RAG 有四成答案会被假证据骗过”。它只是在这个实验设置下的结果。更稳妥的结论是:缺失证据拒答测试通过,不能替代误导证据与冲突证据测试。

五、生产 RAG 应增加哪三道防线

第一道:证据入口治理。记录文档来源、所有者、发布时间、有效期与权限;对匿名上传、过期副本和无法追溯的二次摘要降权或隔离。检索器的相关性分数不是可信度分数。

第二道:跨来源一致性。高风险事实至少需要两个独立来源,或者回到一个明确的权威主来源。只有一段证据时,系统应降低置信度,而不是把流畅当作确认。

第三道:主张级核验。把答案拆成可核验主张,逐条检查来源是否真正支持,是否存在日期、实体与数值冲突。引用链接存在不等于引用正确。

生产 RAG 的三道防线:入口层记录来源权限版本和有效期,检索后做多来源与时间冲突检测,生成后执行主张到证据对齐、风险分级与可解释拒答,并持续保存错误类型和覆盖率
生产 RAG 的三道防线:入口层记录来源权限版本和有效期,检索后做多来源与时间冲突检测,生成后执行主张到证据对齐、风险分级与可解释拒答,并持续保存错误类型和覆盖率

这些防线都要同时报告安全与覆盖率。只追求“少答错”,系统可能通过大量拒答获得漂亮分数;只追求“多回答”,又会掩盖误导证据风险。关于内容侧怎样把时间、口径和来源写得更容易核验,可继续参考《从 RAG 研究到 12 条内容改写规则(可直接执行)》

六、对 GEO 与品牌内容有什么关系

这篇研究不是“怎样提高引用率”的实验,但它揭示了引用生态中的另一种责任:内容被检索并进入答案后,事实边界写得是否足够清楚。

品牌页应该把适用对象、统计区间、版本日期和例外条件写在结论附近;修订旧事实时保留变更记录;同一实体在官网、帮助中心、媒体稿和目录页之间保持一致。否则,生成系统可能同时检索到多个互相冲突的“官方版本”。

同时,企业做 AI 可见度监测时不能只看“是否被引用”。还要抽查引用是否支持对应主张、是否使用了过期版本、是否把条件性结论写成绝对结论。这也是《AI 幻觉与品牌信息错误:企业面临的新型声誉风险》需要从结果监测延伸到证据监测的原因。

边界声明

  • 本文分析对象是 arXiv v1 预印本,不代表同行评审共识。
  • 41.6%、59.6% 与 13.3%等数字只适用于论文的模型、数据集、上下文构造与策略口径。
  • 我们已检查论文 PDF 的方法、结果、限制与附录,但未能独立运行代码或复现实验。
  • 本文不对任何特定生产 RAG 系统的错误率作推断。

本文数据来自 GRAB-RAG 预印本《Prompt-Based Abstention Fails Under Misleading Context》,核查范围包括实验设计、表 1–3、限制与附录。相关工程建议是妙蛙 GEO 基于论文边界作出的分析推论。

本文由妙蛙 GEO 研究团队撰写,使用 AI 辅助进行资料整理与语言校对,文中事实、来源和结论均经人工复核。

继续阅读

相关技术文章

RAGRAG 不只要“搜什么”,还要决定“怎么搜”:ProRetrieval 把混合检索写成可执行程序

8 月 27 日提交的 ProRetrieval 预印本让 4B 模型生成 SQL、文本与图像向量检索组成的可执行程序。本文审计两个 3000 查询基准、12.9 个百分点增益及其生产边界。

GEO当大模型的隐藏推理被恢复:GEO 真正该研究的是决策因果

一篇 116 页的安全论文展示了模型隐藏推理、工具调用与可见答案之间的巨大信息差。它没有破解 GEO 排名算法,却为企业如何研究抓取、检索、证据采用、引用、推荐与转化提供了更可靠的方法论。

RAG你的内容在 RAG 的哪一步被淘汰?检索到生成的五道关卡

大多数企业内容不是输给了竞品,而是在被拿来比较之前就出局了。本文把 RAG 链路拆成一个可诊断的漏斗,并给出每一关的自查方法。