看过不少 RAG 产品的演示,输入干净、问题明确、答案带引用,一切流畅。上线两周后收到的反馈往往是另一回事:答案读起来依然流畅,但引用的是过期文件,或者干脆把没有的信息补了出来。
这不是玄学。演示和线上差的三类失败有一个共同点:静默——没有报错、没有降级提示,输出质量看起来毫无变化。我把它们拆开讲,每一类都附一个五分钟自检法。
知识库里的文档会更新。旧版本被新版本替代后,检索层如果按相关度而非时间排序,很容易把旧文档排在前面——答案引用的就是过期的规则、作废的价格、已经改期的会议。
自检:同一事件准备两份只有日期不同的文档(旧版 3 月 1 日生效、新版 3 月 15 日生效),都上传后问"什么时候生效"。合格的表现是引用新版并说明;最常见的失败是引用旧版但语气笃定,或者把两个日期揉成一个看似合理的数。
问一个两份文档都没写的問題——"谁批准的这次变更"。合格的系统说"文档中没有";不合格的系统会补一个名字出来。演示时没人问这种问题,所以从来不会暴露。
自检:故意问一个知识库范围外的细节,看它是承认边界还是流畅地编。编造的答案往往格式工整、语气自信,比正确答案更像正确答案。
更隐蔽的一类。工具支持按人、按文件授权时,把某份文档的权限移除后再问一次同样的问题。正确的行为是诚实地说"现在无法访问";常见的失败是悄悄退回还剩下的那份文档,把它当成仍然权威——引用还在、格式还在,只是依据已经不对了。
自检:移除权限前后各问一次,对比两次答案的依据是不是变了却没有任何提示。
演示的问题都是"你想得到的问法",输入是干净的,文档是全新的。上面三类失败只在信息过时、边界模糊、权限变化的真实环境里出现——而自检法的本质就是主动制造这三个条件。
还有一个变体值得跑:日期对调重测。把两份文档的日期互换再问一次。靠记住文件顺序通过的工具,这一轮就会露馅。
这个方法是"五分钟测试法"系列的第三篇。前两篇:《测一个 RAG 工具,五分钟就够了:两份日期冲突的文档》讲基本方法,《843 个 RAG 项目,怎么筛到适合你的那一个》讲怎么把它用在选型筛选里。
我把这些方法配套的开源项目目录放在这里(可按分类、活跃度筛,免费浏览):
https://aiworkstation.cn/githubai/
声明:我是 AI 开源项目雷达的开发者。本文由 AI 辅助整理;方法本身是重点,适用于你在用的任何工具。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。