前面三篇讲清了同一件事:模型做的事一直是「读一段文字、接着往下写」。它外面可以套上搜索引擎、文件、计算器,那是别人替它做的;而它读到的文字对不对,它自己并不负责。
这一篇要回答的是最实际的一个问题:一段回答摆在眼前,怎么快速分出哪些内容可以直接用、哪些必须自己查,以及查的时候具体看什么。
先别看它说得对不对,先看它在做哪种活
多数人核验 AI 回答的方式是通读一遍,然后凭“感觉像不像真的”下判断。这个信号是失灵的——流畅、有条理、语气笃定,本来就是这类模型默认的写法。所以第一步不是评价内容,而是判断它在做哪种活,因为不同种类的活,“对错”的标准完全不一样。
第一类:它在处理你已经给它的材料。 改写、翻译、总结、把乱糟糟的记录整理成表格。这类内容的对错其实在你手里:原文是你贴进去的,它有没有漏掉一句关键限定、有没有自己添了原文没有的话,你对着材料扫一眼就知道。这类基本可以直接用,代价只是花半分钟抽查。要特别留意两处:总结最容易丢掉限定条件(原文说“在某些条件下成立”,总结成了“成立”),改写最容易悄悄加料。另外,如果材料本身是错的,它照着重写的也是错的。
第二类:它在说关于这个世界的一件事。 谁在哪一年做了什么、某个数字是多少、某样东西现在卖多少钱、某条规定了什么、某个人说过哪句话。只有这一类存在“事实对错”,也只有这一类必须核。
第三类:它在给判断和建议。 这个方案好不好、值不值得买。这类没有唯一正确答案,你查不出对错,能做的只是问它依据什么,然后自己决定,或者找懂行的人。
真正让人吃亏的,是把第三类当成第一类直接照做,或者把第二类的断言当成“它说得挺像”就信了。
语气有没有把握,不说明它说得对不对
为什么“感觉像真的”不能当证据,前面几篇的机制已经解释了:它的输出是“最像接下来说的话”,而不是“核对过的话”。语气是从训练材料里学来的一种写法,和这次说的内容准不准之间,没有任何机制上的联系。
这不是抽象担心。2023 年美国有律师用 ChatGPT 写诉讼文书,里面引了六个根本不存在的判例,被法院处罚,成了这个问题的标志性案例。
更值得知道的是,这问题没有随着模型换代自动消失。普林斯顿的一项研究(2026 年)用同一批 92 个法律写作提示,问了八代免费版 ChatGPT,产出八千多条判例引用,再逐条到真实法律数据库里核对。结果是:早期的 GPT-3.5 大约有 25% 的引用是编的,2024 年中的 GPT-4o 降到 1.23%,但到 GPT-5.1 又回升到 6.57%,是统计上显著的反弹。同期,他们在真实法院文书里发现的伪造引用累计超过一千份,且逐年增加12。
要说清这份研究的适用范围:它测的是法律文书、免费版模型,这些具体百分比不能直接搬到别的领域或别的产品上。但方向性的结论可以带走——“这是新版本,应该不会乱编引用了”不是一条可以放心依赖的假设。
顺带一条边界:让 AI 带着检索工具去自动核查引用,同样没能解决这件事。同一项研究里,表现最好的一套自动核查系统,在“引用页码对不上”这一类错误上只抓到 18.2%1。所以“让它自己再查一遍”不能替代你自己看。
一条链接摆在回答里,只说明有人给了你一条链接
带联网的产品常常会附上来源链接,看起来很有说服力。但一条链接出现在回答里,只证明“它给出了一条链接”,其他什么都没证明。要跑四道关,顺序不能乱:
- 它存在吗? 链接打得开吗,标题、作者、发布机构是不是真的。
- 信息对得上吗? 模型很常把一篇真论文挂到错误的年份、期刊或作者上,甚至把两篇合成一篇看起来很完整的文献。数据库里能搜到这篇,只证明它存在。
- 这条来源真的支持这句话吗? 这是四步里最常被跳过、也最关键的一步。一篇真实、正经的文章,完全可以被拿去支持它根本没说的结论。比如一份研究报告某指标提升了 40%,而这 40% 只适用于一个很小的子群体,或者只是相关关系,或者用的其实是另一个指标。链接是真的,结论是被放大的。
- 它是一手来源吗? 如果你打开的是一篇“报道某项研究”的文章,就继续往上找那项研究本身34。
所以要记住:“来源存在”是四个检查里最弱的信号,而大多数人只做了这一步。
“两个来源”很可能只是一个来源
想让答案更可靠,自然想再找一个出处。这里有个容易踩的坑:A 文章引用 B 文章,B 引用一篇新闻稿,新闻稿讲的是某公司自己发布的研究——四条链接,其实是同一条证据链戴着四顶帽子。要找的是来源彼此不同、互不依赖的证据5。
换一个模型问同样的问题,也不算独立核实。不同产品很可能读到的是同一批网上材料,或者共用同一个流传很广的错误。几个模型说法一致是个信号,不是证据。
另外有一个动作要避免:问它“你确定吗”。它往往会用同样、甚至更自信的语气,把同一个错误重说一遍。它的回答仍然只是“接着往下写”,不是独立地去核对。核实要拿外面的事实去对它,而不是拿它去对它自己。
查的时候,先看四样东西
对任何“现在怎么样”的说法,依次看这四样:
- 时间:这条信息什么时候发布的,后来有没有更新。一个 2023 年正确的价格、职位、政策,到 2026 年可能就是错的。
- 范围:哪个国家或地区、哪一类账户(个人还是企业)、免费还是付费、网页还是手机应用、哪个版本。别把“正在向部分用户推出”读成“所有人都能用”。
- 口径:数字的分子分母是什么,算的是哪段时间,跟什么比。价格从 80 降到 60,降幅要按 算;但更关键的是,这两个数是不是同一个套餐、同一种货币、同一个计费周期。计算器只能核对算术,核对不了输入本身对不对。
- 后果:这条错了我损失什么。核验是有成本的,力气要花在错了会疼的地方。
一个可以照着走的顺序
- 把回答复制下来留存,别只凭印象判断。
- 按后果排序,挑出最要紧的三条事实性断言——数字、日期、引语、法律和技术细节、随时间变的东西。剩下的(改写、起名、措辞)基本可以直接用。
- 逐条打开最好的来源,重点看它是否支持这句话的原话,有没有被省略的限定条件和反例。
- 必要时找独立来源对照,把结论记成“确认 / 部分确认 / 被反驳 / 还没查清”,而不是简单的“真”和“假”。没查清的那条,别让它悄悄回到你要发出去的稿子里45。
- 涉及健康、法律、金钱、安全的事,查完还要找懂行的人,而不是再问一个聊天机器人。
几条边界
这套做法有个前提:来源是你能查到的。有些事你查不到——数据在付费库里、原始材料不公开、问题本身还有争议。这时候正确的结论是“还没查清”,不是“应该没事”。
也不要反过来把每句话都当成待审的呈堂证供。核验本身要花时间和注意力,这套顺序的价值恰恰在于帮你把这两样东西集中用在错误代价最大的那几条上。