# 为什么写材料要先把研究做在前面

从幻觉的机制和引用伪造率说起，讲清“先攒材料再动笔”到底解决了什么问题

> AI 幻觉 · 有据生成 · 资料整理 · 约 6 分钟 · 09 月 30 日

## 本篇要点

1. 大语言模型本质上是语言处理工具：它根据前文预测最可能的下一段文字，而不是先去查事实再回答。
2. 当任务落在模型的知识边界之外（冷门领域、最新数据、内部资料），它没有事实可召回，却仍会输出格式完整、语气专业的文字，这就是幻觉。
3. 多份研究量化过这类错误：一项研究里 GPT-3.5 的引用有 55% 是伪造的、GPT-4 为 18%；另一项关于医学内容的研究里，115 条引用只有 7% 既真实又准确；被指出引用不存在时，模型会道歉、坚持该文献存在，并给出一个新的假链接。
4. 风险分布并不平均：你越不了解的领域越难发现模型在填空，而“读起来顺不顺”恰好是它最强的地方。
5. 先把真实材料放进上下文，任务就从“凭参数记忆回忆”变成“依据眼前材料转写和重组”，这类做法叫有据生成，RAG 是它的系统化版本。
6. 实验显示，输出的有据程度主要取决于喂进去的材料，而不是提示词怎么措辞——与其改第十版指令，不如多找一份好材料。
7. 给了材料仍会出现两种失败：材料里没依据时模型可能顺势把内容补完，材料互相矛盾时可能只顺着其中一份写下去；用“材料中未提及，不要推测”这类明确出口可以明显减少无依据输出。
8. 研究在前的真正收益是两样：结论变得可以逐条对账，以及你自己手里有了一份不依赖 AI 的判断标准——把关的前提是你能判断内容是否成立，而不只是文字是否通顺。

---

很多人的第一反应是：既然 AI 能写，那就把题目丢给它。输入一句“帮我写一篇关于××的调研报告”，几秒钟后就拿到一份结构完整、小标题工整、语气专业的稿子。看起来省下的是好几天。

真正的麻烦藏在后面：这份稿子写得越顺，你越难发现哪里是编的。

## 它不是在查资料，而是在接着往下猜

要理解这件事，得先弄清大语言模型到底在做什么。它不是一个数据库，也不是一个检索系统。Walters 和 Wilder 在评估 ChatGPT 引用质量的那篇论文里有一句很准确的说法：ChatGPT 根本上是语言处理工具，不是信息处理工具，它模仿的是文本的样子，而不一定是文本里的实质内容。[1]

具体来说，它做的事是：给定前文，预测接下来最可能出现的一段文字。这个机制在写过渡句、把三点并列起来、给一段结论收尾这类任务上表现极好，因为这类文字在训练数据里出现过千千万万次，模式稳定。但对“这个细分行业去年的出货量到底是多少”这种问题，它并没有去查，它生成的只是一个“统计数字通常长这样”的句子。

研究者把这种现象叫幻觉（hallucination）：内容读起来连贯、格式正确，但和事实不符。

## 伪造文献的比例比想象中高

这类问题在多份评估里被量化过，而文献引用恰好是最容易核查、也最容易露馅的一类。

《Scientific Reports》上的一项研究让 ChatGPT-3.5 和 ChatGPT-4 就 42 个跨学科题目写短文献综述，共得到 84 篇文本、636 条引用，然后逐条去数据库核对。结果是：GPT-3.5 引用的文献里 55% 根本不存在，GPT-4 降到 18%；在那些真实存在的文献里，GPT-3.5 有 43%、GPT-4 有 24% 含有实质性错误，比如作者、年份、卷期页码对不上。[1]

另一项针对医学内容的研究更直接：115 条引用里 47% 是伪造的，46% 真实但有错误，只有 7% 既真实又准确。[3]

最值得记住的还不是比例，而是模型被追问时的反应。有研究在发现某条引用查不到之后，直接告诉 ChatGPT“这条文献找不到”，得到的回应是：模型诚恳道歉，坚持这条文献存在，然后给出一个新的 DOI 或网址——同样不存在。[2]

这就是为什么“AI 一本正经胡说”不是偶发的 bug，而是这类工具在没有事实可依据时仍然照常输出的必然结果。模型版本在进步，但这个问题只是变小，没有消失：同一批文本里，GPT-4 引用书章节时的伪造率仍达 70%。[1]

## 风险分布并不平均，恰恰集中在你看不懂的地方

值得再往前推一步：同一个模型，为什么有些稿子能用，有些不能用？

差别在于这个题目有多少落在模型的知识边界之外。热门话题、被反复写过几十年的内容，训练数据里到处都是，模型即使“记不清”，也大概率能写个八九不离十。冷门的细分领域、最新的数据、行业内部资料、你自己公司的业务情况，这些内容在训练数据里稀薄甚至没有，任务越往这个方向走，模型越只能靠“合理的措辞”填空。

更麻烦的是：你对这个领域了解越少，就越难发现它在填空。你唯一能判断的是“读起来顺不顺”，而顺不顺恰好是它最擅长的事。判断力不足的地方，AI 的输出会显得最漂亮。

## 先把材料放进去，任务性质就变了

研究的价值有一半在于喂给 AI，另一半在于喂给你自己。

先说喂给 AI 这部分。当你手里已经有几份真实材料——报告、访谈记录、后台数据、已发表的论文——把它们连同题目一起交给模型，并明确要求：只根据这些材料写，每个结论后面标出它来自哪份材料，材料里没有的信息不要补充。

这时模型的任务从“回忆”变成了“转写和重组”。它不需要知道那个数字是多少，它只需要看得见那个数字，然后把它安排到合适的位置。这种做法在研究和工程里叫 grounding（有据生成）：把相关材料放进模型的上下文，让它依据眼前的材料生成，而不是依据参数里模糊的记忆。RAG（检索增强生成）就是把“先检索、再生成”做成系统流程的一类做法，[4] 而只把文档贴进对话窗口、不改动模型的简化版本，效果同样明显。[5]

有一条结论对实际操作特别重要：在一项关于长文生成的研究里，输出内容的有据程度主要取决于喂进去的信息，而不太取决于提示词怎么措辞。[6]

这对反复打磨提示词的人是个提醒：与其把指令改到第十版，不如多找一份靠谱的一手材料。

## 但“材料在前”也不是万能的

边界必须说清楚，否则等于换了一种迷信。

材料给到模型之后，仍然有两种典型失败。第一种是缺料：材料里没有回答某个问题的依据，模型未必会停下来告诉你“这里没依据”，而可能顺着自己原有印象把这一段补完。第二种是材料互相矛盾：模型未必会把冲突摆出来，而可能只顺着其中一份往下写。[7]

对应的操作也很简单：在指令里给它一个“材料不足”的出口，明确说“如果材料里找不到依据，就写‘材料中未提及’，不要推测”。这个动作被验证过——把无法回答的问题明确标出来，能明显减少无依据的输出。[6]

## 研究在前真正买回来的两样东西

第一样是可核查性。稿子里的每个结论都能对应到你手上某一份材料，核对就变成逐条对账，而不是从头再查一遍。你手里有原始材料，才有能力判断某句话是“材料支持”还是“模型补的”。

第二样，也是更根本的一样：你自己的判断标准。把关有个前提——手边得有一份不依赖 AI 的参照物。没有它，你只能判断文字是否通顺；有了它，你才能判断内容是否成立。研究这一步看着是在给 AI 准备素材，实际上是在给你自己准备判断依据。

所以“先研究再动笔”不是一种更慢的做法，而是先把成本花在能产生判断力的那一步。跳过这一步，省下的时间会以另一种形式还回来：稿子交出去之前你心里没底，出了问题之后你也不知道该从哪里查起。

落实到动作上，顺序大致是：

- 先写下这篇材料要回答的三到五个具体问题。是问题决定你要找什么，而不是反过来。
- 找一手材料，边找边摘录，每条摘录旁边记两件事：出处，以及它支撑哪个问题的哪一句结论。
- 拿到初稿后逐条对账，凡是标不出出处、或者对不上原材料的句子，要么删掉，要么去找材料补上。

这套顺序里最重要的不是哪一句指令，而是第二步能不能老实做。有了第二步，后面两步才有东西可依据。

## 术语表

- 幻觉（hallucination）：模型生成出来的内容读起来连贯、格式正确，但与事实不符。
- 参数记忆（parametric memory）：模型训练时压进参数里的知识，看不见、查不到，可能过时，也可能根本没有。
- 上下文（context）：这一轮对话里你实际提供给模型的全部文字，包括你贴进去的材料。
- 有据生成（grounding）：把相关材料放进上下文，让模型依据眼前的材料写，而不是凭记忆写。
- RAG（检索增强生成）：先检索出相关材料、再让模型基于材料生成的一类系统化做法。
- 伪造引用（fabricated citation）：格式看起来完整、实际上并不存在的那类文献条目。

## 来源

1. [Fabrication and errors in the bibliographic citations generated by ChatGPT（Scientific Reports）— 核查 636 条引用的伪造率与引用错误率](https://www.nature.com/articles/s41598-023-41032-5)
2. [Retracting ChatGPT: completeness and relevance of academic references（Discover Education）— 记录模型被指出引用不存在时仍坚持原答案](https://link.springer.com/article/10.1007/s44217-024-00333-1)
3. [High Rates of Fabricated and Inaccurate References in ChatGPT-Generated Medical Content（Cureus）— 115 条引用中仅 7% 真实且准确](https://doi.org/10.7759/cureus.39238)
4. [Retrieval-Augmented Generation for AI-Generated Content: A Survey — RAG 如何用外部材料缓解幻觉与知识过时](https://arxiv.org/html/2402.19473v6)
5. [In-Context RALM: In-Context Retrieval-Augmented Language Modeling（TACL）— 只把文档放进上下文也能提升事实性](https://aclanthology.org/2023.tacl-1.75.pdf)
6. [Analysis of Plan-based Retrieval for Grounded Text Generation（EMNLP 2024）— 有据程度更依赖检索到的信息，标注“无法回答”可减少无依据生成](https://aclanthology.org/2024.emnlp-main.727.pdf)
7. [Hallucination Mitigation for Retrieval-Augmented Large Language Models（Mathematics）— 区分检索失败与生成阶段处理上下文不当两类幻觉来源](https://www.mdpi.com/2227-7390/13/5/856)

---

原文：https://pangzhengboyin.com/articles/why-research-before-ai-writing-f0f9ba08

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
