# 哪句话能直接用，哪句话必须自己查：核验 AI 回答的一条顺序

先分清它在做哪种活，再决定要不要查；来源链接要跑四道关，而“链接存在”是最弱的那一道

> 使用技巧 · 幻觉 · 约 7 分钟 · 09 月 28 日

## 本篇要点

1. 核验 AI 回答的起点不是“它说得像不像真的”，而是先分清它在做哪种活：处理你给的材料（对错在原文里）、断言世界上的事实（必须查）、给判断和建议（查不出对错，但要问依据）。
2. 它的语气笃定程度和内容正确性之间没有机制上的联系，所以“感觉可信”是不能用的信号。
3. 普林斯顿 2026 年的研究显示，免费版 ChatGPT 编造法律引用的比例并非逐代下降：GPT-3.5 约 25%，GPT-4o 降到 1.23%，GPT-5.1 又回升到 6.57%；真实法院文书里的伪造引用累计超过一千份。这些百分比只适用于该实验的法律场景与免费版模型，可带走的方向性结论是：不能因为“这是新版”就放松对引用的警惕。
4. 自动核查也靠不住：同一研究中最好的自动系统只抓到 18.2% 的“页码引错”，所以“让它自己再查一遍”不能替代自己看。
5. 一条来源链接要跑四道关：是否存在、年份作者等信息是否对得上、是否真的支持这句话、是不是一手来源。其中“存在”是最弱的信号，而大多数人只做了这一步。
6. 多条链接可能只是同一条证据链（A 引 B，B 引新闻稿，新闻稿讲公司自己的研究）；换一个模型问同样的问题也不算独立核实。
7. 不要问模型“你确定吗”，它通常会用同样的自信重复同一个错误。
8. 核实“现在怎么样”的说法时，依次看时间、范围、口径和错误后果；数字要自己重算，并检查输入是否属于同一对象。
9. 查不到时正确的结论是“还没查清”，不是“应该没事”；核验有成本，力气要用在错误代价最大的几条上。
10. 涉及健康、法律、金钱、安全的事，除了查证还要找懂行的人。

---

前面三篇讲清了同一件事：模型做的事一直是「读一段文字、接着往下写」。它外面可以套上搜索引擎、文件、计算器，那是别人替它做的；而它读到的文字对不对，它自己并不负责。

这一篇要回答的是最实际的一个问题：一段回答摆在眼前，怎么快速分出哪些内容可以直接用、哪些必须自己查，以及查的时候具体看什么。

## 先别看它说得对不对，先看它在做哪种活

多数人核验 AI 回答的方式是通读一遍，然后凭“感觉像不像真的”下判断。这个信号是失灵的——流畅、有条理、语气笃定，本来就是这类模型默认的写法。所以第一步不是评价内容，而是判断它在做哪种活，因为不同种类的活，“对错”的标准完全不一样。

**第一类：它在处理你已经给它的材料。** 改写、翻译、总结、把乱糟糟的记录整理成表格。这类内容的对错其实在你手里：原文是你贴进去的，它有没有漏掉一句关键限定、有没有自己添了原文没有的话，你对着材料扫一眼就知道。这类基本可以直接用，代价只是花半分钟抽查。要特别留意两处：**总结最容易丢掉限定条件**（原文说“在某些条件下成立”，总结成了“成立”），**改写最容易悄悄加料**。另外，如果材料本身是错的，它照着重写的也是错的。

**第二类：它在说关于这个世界的一件事。** 谁在哪一年做了什么、某个数字是多少、某样东西现在卖多少钱、某条规定了什么、某个人说过哪句话。只有这一类存在“事实对错”，也只有这一类必须核。

**第三类：它在给判断和建议。** 这个方案好不好、值不值得买。这类没有唯一正确答案，你查不出对错，能做的只是问它依据什么，然后自己决定，或者找懂行的人。

真正让人吃亏的，是把第三类当成第一类直接照做，或者把第二类的断言当成“它说得挺像”就信了。

## 语气有没有把握，不说明它说得对不对

为什么“感觉像真的”不能当证据，前面几篇的机制已经解释了：它的输出是“最像接下来说的话”，而不是“核对过的话”。语气是从训练材料里学来的一种写法，和这次说的内容准不准之间，没有任何机制上的联系。

这不是抽象担心。2023 年美国有律师用 ChatGPT 写诉讼文书，里面引了六个根本不存在的判例，被法院处罚，成了这个问题的标志性案例。

更值得知道的是，这问题没有随着模型换代自动消失。普林斯顿的一项研究（2026 年）用同一批 92 个法律写作提示，问了八代免费版 ChatGPT，产出八千多条判例引用，再逐条到真实法律数据库里核对。结果是：早期的 GPT-3.5 大约有 25% 的引用是编的，2024 年中的 GPT-4o 降到 1.23%，但到 GPT-5.1 又回升到 6.57%，是统计上显著的反弹。同期，他们在真实法院文书里发现的伪造引用累计超过一千份，且逐年增加[1][2]。

要说清这份研究的适用范围：它测的是法律文书、免费版模型，这些具体百分比不能直接搬到别的领域或别的产品上。但方向性的结论可以带走——**“这是新版本，应该不会乱编引用了”不是一条可以放心依赖的假设。**

顺带一条边界：让 AI 带着检索工具去自动核查引用，同样没能解决这件事。同一项研究里，表现最好的一套自动核查系统，在“引用页码对不上”这一类错误上只抓到 18.2%[1]。所以“让它自己再查一遍”不能替代你自己看。

## 一条链接摆在回答里，只说明有人给了你一条链接

带联网的产品常常会附上来源链接，看起来很有说服力。但一条链接出现在回答里，只证明“它给出了一条链接”，其他什么都没证明。要跑四道关，顺序不能乱：

```mermaid
flowchart LR
  A["回答里的来源链接"] --> B["1 它存在吗"]
  B --> C["2 年份作者出版方对得上吗"]
  C --> D{"3 这条来源支持这句话吗"}
  D --> E["4 它是一手来源吗"]
  D --> F["不支持就记为尚未证实"]
```

1. **它存在吗？** 链接打得开吗，标题、作者、发布机构是不是真的。
2. **信息对得上吗？** 模型很常把一篇真论文挂到错误的年份、期刊或作者上，甚至把两篇合成一篇看起来很完整的文献。数据库里能搜到这篇，只证明它存在。
3. **这条来源真的支持这句话吗？** 这是四步里最常被跳过、也最关键的一步。一篇真实、正经的文章，完全可以被拿去支持它根本没说的结论。比如一份研究报告某指标提升了 40%，而这 40% 只适用于一个很小的子群体，或者只是相关关系，或者用的其实是另一个指标。链接是真的，结论是被放大的。
4. **它是一手来源吗？** 如果你打开的是一篇“报道某项研究”的文章，就继续往上找那项研究本身[3][4]。

所以要记住：**“来源存在”是四个检查里最弱的信号，而大多数人只做了这一步。**

## “两个来源”很可能只是一个来源

想让答案更可靠，自然想再找一个出处。这里有个容易踩的坑：A 文章引用 B 文章，B 引用一篇新闻稿，新闻稿讲的是某公司自己发布的研究——四条链接，其实是同一条证据链戴着四顶帽子。要找的是来源彼此不同、互不依赖的证据[5]。

换一个模型问同样的问题，也不算独立核实。不同产品很可能读到的是同一批网上材料，或者共用同一个流传很广的错误。几个模型说法一致是个信号，不是证据。

另外有一个动作要避免：问它“你确定吗”。它往往会用同样、甚至更自信的语气，把同一个错误重说一遍。它的回答仍然只是“接着往下写”，不是独立地去核对。核实要拿外面的事实去对它，而不是拿它去对它自己。

## 查的时候，先看四样东西

对任何“现在怎么样”的说法，依次看这四样：

- **时间**：这条信息什么时候发布的，后来有没有更新。一个 2023 年正确的价格、职位、政策，到 2026 年可能就是错的。
- **范围**：哪个国家或地区、哪一类账户（个人还是企业）、免费还是付费、网页还是手机应用、哪个版本。别把“正在向部分用户推出”读成“所有人都能用”。
- **口径**：数字的分子分母是什么，算的是哪段时间，跟什么比。价格从 80 降到 60，降幅要按 $(80-60)/80$ 算；但更关键的是，这两个数是不是同一个套餐、同一种货币、同一个计费周期。计算器只能核对算术，核对不了输入本身对不对。
- **后果**：这条错了我损失什么。核验是有成本的，力气要花在错了会疼的地方。

## 一个可以照着走的顺序

1. 把回答复制下来留存，别只凭印象判断。
2. 按后果排序，挑出最要紧的三条事实性断言——数字、日期、引语、法律和技术细节、随时间变的东西。剩下的（改写、起名、措辞）基本可以直接用。
3. 逐条打开最好的来源，重点看它是否支持这句话的原话，有没有被省略的限定条件和反例。
4. 必要时找独立来源对照，把结论记成“确认 / 部分确认 / 被反驳 / 还没查清”，而不是简单的“真”和“假”。没查清的那条，别让它悄悄回到你要发出去的稿子里[4][5]。
5. 涉及健康、法律、金钱、安全的事，查完还要找懂行的人，而不是再问一个聊天机器人。

## 几条边界

这套做法有个前提：来源是你能查到的。有些事你查不到——数据在付费库里、原始材料不公开、问题本身还有争议。这时候正确的结论是“还没查清”，不是“应该没事”。

也不要反过来把每句话都当成待审的呈堂证供。核验本身要花时间和注意力，这套顺序的价值恰恰在于帮你把这两样东西集中用在错误代价最大的那几条上。

## 术语表

- 事实性断言：回答里那种“关于世界是怎样”的说法，比如数字、日期、人名、价格、条文。只有这类内容存在可核对的对错，也是唯一必须去查的一类。
- 一手来源：直接记录或发布某件事的那份材料本身，比如原始研究、官方文件、录音原话。你打开的是报道它的文章时，就还没到头。
- 来源支持度：一条真实存在的来源，是否真的说了回答里的那句话。文献存在和文献支持这句话是两回事，后者最常被跳过。
- 证据链：多条链接其实都源自同一份材料（互相转引、共享同一篇新闻稿）。它们只算一份证据，不算互相印证。
- 未查清：查不到、来源不公开或说法冲突时的结论状态。它和“被反驳”不一样，但同样不能当成“可以用”。

## 来源

1. [Princeton CITP: Can AI reduce burdens on courts by automatically verifying citations? — 八代模型引用幻觉率与自动核查检出率数据](https://blog.citp.princeton.edu/2026/05/27/can-ai-reduce-burdens-on-courts-by-automatically-verifying-citations/)
2. [Who Checks the Citations? Benchmarking Legal Hallucination Detection — 同项研究论文，含 GPT-3.5 / GPT-4o / GPT-5.1 幻觉率与真实法院文书统计](https://princeton-polaris-lab.github.io/legal-hallucination-webpage/Legal_Hallucination.pdf)
3. [Boston University Libraries: Verifying and citing generative AI — 面向学生的核验指引，强调 AI 输出是起点而非来源](https://library.bu.edu/gen-ai/verifying-citing)
4. [VSC Libraries: How can I fact-check the information AI tools like Copilot give me? — 如何核验带来源链接的 AI 回答](https://help.libraries.vsc.edu/subject/faq/409500)
5. [How to Fact-Check With AI: Verify Claims, Sources and Websites — 分步核验流程与证据链重复问题](https://www.sigmabrowser.com/blog/how-to-fact-check-with-ai)

---

原文：https://pangzhengboyin.com/articles/how-to-verify-ai-answers-and-citations-da205527

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
