用老祖宗的智慧根治大模型幻觉

用老祖宗的智慧根治大模型幻觉
蔡坨坨转载请注明出处❤️
作者:测试蔡坨坨
原文链接:caituotuo.top/710f774e.html
你好,我是测试蔡坨坨。
相信大家在使用 GPT、Claude、DeepSeek 这些模型时,一定碰到过幻觉问题。
尽管语言模型能力日益增强,但「幻觉」现象始终是难以彻底解决的顽疾。
最可怕的是,它总能给你一个答案。
不管信息够不够,它很少主动停下来。答案有背景、有术语,推导看起来也很完整。结果一核对,论文不存在,版本号是编的,连链接都打不开。
这种看起来合理,实际却是错误或无法验证的内容,就是大模型幻觉。
它不会像代码报错那样给你一个红色提示,还可能把真资料和假结论混在一起。我们又很容易把「有答案」误认为「它知道答案」。
为什么会这样?LLM 的预训练是在预测下一个 token。它学的是「接下来出现什么最合理」,不是「这句话有没有经过事实验证」。监督微调和偏好对齐能减少错误,但如果评测更喜欢完整答案,模型还是会倾向于猜一个。
所以,解决幻觉不能只靠一句「请准确回答」。还得让模型知道什么时候该停,什么时候该找证据。
后来我想到《论语·为政》里的一句话,把它写进了 Agent 的 soul.md。
知之为知之,不知为不知,是知也。
效果竟然相当不错。它没有告别幻觉,但碰到证据不足的地方,开始愿意说明缺了什么,请我确认。
不得不佩服老祖宗的智慧。
先把边界说清楚
Agent 遇到陌生内容就直接拒答,同样没法干活。这句话管的是回答边界。
我希望它继续查,也可以根据现有资料往下推,但要说清楚依据。
有资料直接支撑的,算确定事实;资料不完整但推导说得通的,算逻辑推断;找不到依据的,只能算猜测,需要把问题交还给人。
不是闭嘴,是别装懂。
为什么它总能接着编
预测下一个 token 只是原因之一。
LLM 还要经过监督微调和偏好对齐,而人类偏好也不总是指向事实。Sharma 等人的研究发现,经过人类反馈微调的 AI 助手会出现迎合倾向,也就是阿谀奉承。
资料不足时继续补全,容易产生幻觉;推理没有证据钉住,会越写越远;用户先给结论,模型又容易顺着说。
OpenAI 在 2025 年发过一篇研究,题目就叫 Why Language Models Hallucinate。里面有个观点我很认同,很多评测只奖励答对,却没有奖励模型在不确定时放弃作答。
这种评分方式其实是在逼模型猜。就像考试时不会也要蒙,空着肯定没分,写了还有机会撞对。想让 Agent 诚实,就得让「我不确定,先去查」也能得分。
7 条规则,直接放进 soul.md
一句古话还不够具体,我把它补成了可执行的规则。
1 | ## 认知诚实 |
其中第 4 条最为关键。编一段分析,可能只是浪费几分钟;编一个不存在的版本号、论文标题或 API,真的会把人带沟里。
别太信那个 90%
你问 Agent 有多大把握,它张口就能给你一个 90%。这个数字看着很科学,实际上也可能是现编的。
关于 LLM 自报置信度的研究发现,模型经常过度自信,换一种问法,结果还可能跟着变。所以我更愿意看证据、多次回答的一致性和独立来源。
按照这个思路,我整理了一张评分表。
| 评分维度 | 我在检查什么 | 权重 |
|---|---|---|
| 证据支撑度(Evidence) | 外部资料能不能直接支撑答案 | 40% |
| 多次回答一致性(Consistency) | 多次独立采样后,结论是否稳定 | 25% |
| 信源交叉验证(Cross Validation) | 独立来源能不能互相对上 | 15% |
| 生成不确定性(Uncertainty) | 关键 token 和实体是否反复摇摆 | 10% |
| 来源可靠性(Source Quality) | 来源是官方文档、论文、源码,还是二手转述 | 5% |
| 知识边界检测(Boundary) | 问题是否超出当前资料和工具的覆盖范围 | 5% |
每项按 0~100 分计算后乘以权重。生成越摇摆,不确定性得分越低。
🟢 85~100 分,可以给明确结论;🟡 65~84 分,只给条件性判断;🔴 低于 65 分,先查资料或找人确认。
这里还得留个后门。关键事实没有直接证据,或者几个可靠来源互相打架,即使总分看着不低,也不能标绿。加权分只能帮我们排风险,不能把硬伤平均掉。
这几个维度对应了业界常见的研究方向。Self-Consistency看多次回答是否收敛,Uncertainty Estimation 看 token 概率和语义差异,RAG Grounding Score 检查结论有没有检索资料支撑,Calibration则用历史正确率校准置信度。单个指标都不保险,放在一起更实用。
还要几道保险
一句话无法消灭所有幻觉。上下文会稀释规则,检索资料可能过期,模型甚至会编一份看起来很专业的证据分析。标题里的「根治」,针对的是一个坏习惯,没证据也要把答案补完整。
真放到生产环境里,Prompt 只能守第一道门。后面还要接官方文档和内部知识库,关键结论绑定引用,版本号、接口名、数字和链接交给程序校验,高风险操作继续保留人工确认。
还可以挑 20 个最容易翻车的问题做回归测试。每次调整 soul.md 后重新跑一遍,看它会不会乱编,该求助时能不能停下来。
回到那句话
真正的「知」,也包括知道自己的边界。把这句话写进 soul.md,不会让 Agent 变得全知,但能让它少装懂一点。
如果你也在维护自己的 soul.md、AGENTS.md 或系统提示词,可以先把上面的规则拿走,再用手头那些最容易产生幻觉的问题试一遍。
别只看它回答得像不像。
看它凭什么这么回答。
参考资料
- Why Language Models Hallucinate(OpenAI,2025)
- Self-Consistency Improves Chain of Thought Reasoning in Language Models(Wang et al.,2022)
- Language Models (Mostly) Know What They Know(Kadavath et al.,2022)
- Can LLMs Express Their Uncertainty?(Xiong et al.,2023)
- Towards Understanding Sycophancy in Language Models(Sharma et al.,2023)
- RAGAs: Automated Evaluation of Retrieval Augmented Generation(Es et al.,2024)
- On Calibration of Modern Neural Networks(Guo et al.,2017)






