
拒答机制与引用来源:让 RAG 不再"胡说八道"专栏导航:这是《LangChain 30篇精讲》系列的第 17 篇,模块四:RAG 实战的第四篇。上一篇我们把检索做准了,但还有一个更棘手的问题:即使检索到了相关资料,模型也可能编造答案。本篇讲的就是怎么让 RAG “学会说不知道”,以及怎么让每个答案都有据可查。写在前面:一个"太能干"的客服机器人某公司上线了一个内部客服机器人,知识库是员工手册和产品文档。上线第一周,效果"很好"——几乎什么问题都能答,回答也通顺流畅,格式规整。第二周出事了。有个新员工问:“年假可以跨年累积吗?”机器人回答:“可以的,未使用的年假可以累积到下一年度,最多累积 5 天。”但员工手册里根本没写这条。手册里只写了"年假须在当年度使用完毕"。那个"可以累积,最多 5 天"——是模型自己编的。新员工照着这个答案去请假,被人事打回,还闹了点小矛盾。问题不在于模型能力不够,恰恰在于它"太能干了"。大模型有个天性:它倾向于生成流畅、合理的回答,即使它根本不知道答案。因为 LLM 的训练目