# 别让 AI 说“综上所述”：把一堆材料拆成一张论据表

把材料拆到论据一级，按说法分行记录支持、反对、口径差异和真实源头，共识才不会变成数份数

> 资料整理 · AI 引用可靠性 · 有据生成 · 约 8 分钟 · 09 月 30 日

## 本篇要点

1. AI 做多份材料综合时最典型的失败不是编造事实，而是把带条件的发现升级成适用范围更宽的普遍结论，以及写出读起来像结论的空话。
2. 一篇材料不是一条证据，而是一批说法；只有作者实测的数据和它引用的数据能直接当论据，作者的判断必须标清归属才能使用。
3. 一条论据的界线是：把年份、对象、单位、口径换掉之后这句话还成不成立；不成立，这些条件就是论据本身的一部分，必须一起抄下来。
4. 论据表要按“说法”分行而不是按材料分行，这样动笔时能直接抄，哪一行是空的也一眼看得见。
5. 材料之间的矛盾有三种而不是两种：支持、反对、以及口径不一致；AI 综合时最容易把第三种当成第一种处理。
6. 共识不能按份数计算：投票计数忽略样本大小、效应大小和研究质量，Cochrane 手册明确把基于统计显著性的投票计数列为不可接受。
7. “真实源头”这一列用来识别循环引用——多份材料互相印证，沿引用链回溯却指向同一个出处，这时它只值一份的份量，是孤证而非多方印证。
8. 可以让 AI 做原话抽取、论据归组、标出口径差异；不能让 AI 判断哪边证据更重、写出“综上所述”。
9. 把输出格式定死（说法原话、条件、出处编号、实测还是判断、源头是否相同），能压缩它替你把话说圆的空间。

---

上一篇收尾时，你手上有两样东西：一份排好序的待查问题清单，和一张每行都拴着出处的表。假设现在材料也攒得差不多了，十几份报告、访谈、行业文章摊在面前。

这时最顺手的动作是：把它们整个丢给 AI，说“帮我综合一下，写成一段结论”。几秒钟后你会拿到一段读起来很像结论的话，开头是“综上所述”，中间是“整体来看”“业内普遍认为”，结尾是“因此建议”。

这段话最大的问题不是它可能编错，而是它丢掉的东西你根本看不出来。这篇文章要解决的，就是在动笔之前多插一步：把每份材料里的说法拆成一条条独立的论据，排成一张能看出**共识、分歧和孤证**的表。这一步做完，你写出来的句子才是“某公司 2024 年的内部数据是……”，而不是“业内普遍认为……”。

## “综上所述”丢掉的不是句子，是三样东西

先看一个真实例子。一篇医学论文的原话是：每周一次 0.75 毫克或 1.5 毫克的度拉糖肽，在 26 周内改善血糖控制的效果优于安慰剂，受试者是正在接受或不接受治疗的 2 型糖尿病青少年。[2]

一个模型把它概括成：度拉糖肽是改善青少年 2 型糖尿病血糖控制的**有效且安全的治疗选择**。

每个词都能在原文里找到影子，所以它不像“幻觉”。但剂量没了、对照组没了、26 周这个时间窗没了，“安全”这个词原文根本没测。原文那句是有条件的发现，摘要那句是适用范围宽得多的普遍结论。研究里把这种现象叫**过泛化**。

这项研究测了 10 个主流模型、约 4900 份摘要。即便明确要求“忠实原文”，多数模型仍然给出比原文更宽的结论；DeepSeek、ChatGPT-4o、LLaMA 3.3 70B 这几个模型出现这种情况的比例在 26% 到 73% 之间。和人类写的同类摘要比，AI 摘要包含宽泛结论的可能性大约高 5 倍。更反直觉的是：明确要求它“准确、忠实”之后，宽泛结论的几率大约翻倍。[2]

另一项针对多份文档摘要的评测给出了补充画面：在它的评测口径下，最多 75% 的生成内容被判为幻觉，但这些“幻觉”里真正编造事实的只占 0% 到 9%；人工核对 700 多条之后发现，多数错误的毛病是写得**大而空**，或者没按指令做。[1]

这两项结果拼起来，正好说明“综上所述”的危险在哪：AI 做综合时最典型的失败不是写出假数字，而是写出没有信息量、却读起来像结论的句子。“综上所述，行业整体呈现……”就是这类句子的标准形态。

所以丢掉的到底是哪三样？

- **条件**。哪一年、哪个群体、哪个口径、跟谁比。上面那个例子丢的就是这一整层。
- **数量与质量**。三份材料说 A、一份说 B，这个 3 比 1 本身可能就是假象。
- **来源**。三段话分别出自谁、最早出自哪份东西，被缝进了一句“多数研究认为”。

自己拆，就是把这三位留住。

## 拆的单位是“说法”，不是“材料”

系统综述这套成熟流程里有个细节值得抄：一份报告可能描述多项研究，一项研究又会报出多个结果，所以提取数据的单位要选得比“文献”更细。[5] 换成写材料：**一篇材料不是一条证据，它是一批说法。**

随手打开一篇行业文章，里面通常混着四种句子：

1. 作者自己测出来或统计出来的数据；
2. 作者引用别人的数据或结论；
3. 作者自己的判断和建议；
4. 背景介绍、定义、铺垫。

只有前两类能直接当论据。第三类不是不能用，但必须标清“这是谁的判断”，它的分量和实测数据不在一个层级上。第四类直接跳过。

那怎么判断一句话该不该拆成一条论据？一个够用的标准是：**把年份、对象、单位换掉之后，这句话还成不成立？** 如果不成立，那这些条件就是这句话的一部分，必须跟着一起抄下来。用这个标准回头看“度拉糖肽是有效的治疗选择”，换成别的剂量、别的时长都还“成立”，正好说明它的条件已经被丢光了。

具体操作上，一份材料只挑三类句子抄：带数字或日期的、描述具体案例的（谁、什么时候、做了什么、结果如何）、明确下判断的。每条**只抄原话**，不做任何改写——改写就是第一次泛化，而第一次泛化往往就发生在你自己手上。

## 论据表：按“说法”排，不按材料排

接下来是关键动作：把不同材料里**在说同一件事**的论据排到一起。

判断“同一件事”的标准不是用词像，而是把条件写全之后，它们是不是在回答清单上的同一个问题。

表可以长这样（纵向按说法，横向是几个固定列）：

| 清单问题 | 说法 | 支持（材料号＋原话） | 反对 | 口径不一致 | 真实源头 | 实测数据还是作者判断 |
|---|---|---|---|---|---|---|

举个客服外包的例子。材料 A 说某公司外包之后人均客服成本下降了 18%，材料 B 说另一家公司外包之后单位成本上升了。表面看是分歧，但如果 A 算的是纯人力单价、B 算的是含管理费的总成本，这两条就不构成对立——它们落在“**口径不一致**”这一列。

这一列是整张表里最容易被忽略、也最有用的设计。因为它提醒你：材料之间的矛盾有三种，不是两种。除了“支持”和“反对”，还有大量“其实说的是两件事”，而 AI 做综合时最常做的事，就是把这第三种悄悄按第一种处理掉。

最后一列“真实源头”是为下一节准备的。

## 共识不能数份数

一旦表里出现几行，人会本能地开始数：三条支持、一条反对，那这条结论就站得住。

在方法学上这有个名字，叫**投票计数**：把支持的研究数和反对的研究数比一比，谁多听谁的。Cochrane 手册对这种做法的判断很直接——基于统计显著性的投票计数有严重局限，是不可接受的；它不看样本大小、不看效应大小、不区分研究质量。[3] 更别扭的一点是，参与计数的小研究越多，这种数法反而越不容易给出正确结论。

放到写材料的场景：一份覆盖全部 200 家门店的内部经营数据，和三家行业媒体你抄我、我抄你的评论文章，不是 1 比 3 的关系。表里支持列有三行，不等于有三份证据。

这就说到了“真实源头”那一列。**看起来多个来源，实际上是一个来源**，在新闻行业有个老名字：循环引用。维基百科上有个典型例子：有人往条目里写错了一个产品年份，一家主流媒体照抄，随后条目又反过来引用这家媒体，于是错误变得很难删。[4]

这种链在你的材料堆里比想象中容易出现，尤其是当你把几篇 AI 生成的行业综述也放进来了——它们可能各自都在转述同一份报告。所以论据表里要数的是**独立的原始源头个数**，不是文件个数。三份材料都追溯到同一份报告，这一组就是孤证。孤证不等于错，但它只值一份的份量，不能写成“多方印证”。

## 这一步哪些交给 AI，哪些必须自己留

拆论据是可以让 AI 帮忙的，但要把活拆开。

**可以让它做的：**

- **抽取**。给每份材料编号，要求“只抄原话，附上位置”，明确禁止改写和概括。
- **分组**。把抽出来的候选论据按“是否在说同一件事”归组，并说明为什么归到一组；同时明确允许它输出“无法归组”。
- **找口径差异**。把同一组论据里条件不一致的地方列出来，交给你判断。

**不要让 AI 做的：** 判断哪边证据更重、写出“综上所述”。这恰好是它的过泛化倾向发作得最厉害的地方，而且你越是要求它“忠实”，它反而越容易升级结论。[2]

一个可直接用的输出格式要求是：每条只给五样东西——说法原话、条件（对象·时间·地区·单位）、出处编号、是实测数据还是作者判断、源头是否与其他条目相同。格式定死，它就没多少空间替你把话说圆。

收工前自查两件事：表里有没有“无法归组”的行你没处理；支持列里那几行的“真实源头”是不是同一个。

## 这张表改变了什么

它带来的收益不是“更全面”，而是让三种原本糊在一起的状态变得分得开：多方独立支持的，可以写成结论；口径不同或结论冲突的，要写明条件再并列；只有孤证的，要么去补，要么在文里明写成“目前只有一份资料提到”。第三种不是失败，它本身就是一条结论——上一篇文章里那句“未查到”留在表上的价值，在这里兑现了。

表填到这一步，你手上的东西已经从“一堆材料”变成了“一组有份量标记的说法”。下一篇要做的，是用这些说法排出一份提纲，再让 AI 按表逐句写——那时它每一次“自己发挥”，你都有地方对照。

## 术语表

- 论据级拆分：一份材料不是一条证据，而是拆成若干条能单独判断真假、单独标注条件的说法。
- 论据表：按“说法”分行，把不同材料中讲同一件事的论据排在一起，并排标出支持、反对、口径差异和真实源头。
- 口径不一致：两条看似对立的说法，其实在算不同的东西（比如一个是人力单价，一个是含管理费的总成本），既不支持也不反对。
- 孤证：只有一个独立源头支持的说法；无论被多少份材料转引，份量仍然是一份。
- 循环引用：多份材料看起来互相印证，沿引用链回溯却都指向同一个原始出处，于是单来源伪装成多来源。
- 投票计数：按支持与反对的份数多少下结论，不看样本大小、效应大小和研究质量。
- 过泛化：把带条件的结论升级成适用范围更宽的普遍说法，是 AI 做摘要与综合时反复出现的倾向。

## 来源

1. [From Single to Multi: How LLMs Hallucinate in Multi-Document Summarization — 多份文档摘要的幻觉评测，含错误构成与幻觉比例](https://arxiv.org/abs/2410.13961)
2. [Generalization bias in large language model summarization of scientific research — 约 4900 份科学摘要的过泛化比较与度拉糖肽实例](https://royalsocietypublishing.org/doi/10.1098/rsos.241776)
3. [Cochrane Handbook Chapter 12: Synthesizing and presenting findings using other methods — 投票计数的局限说明](https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-12)
4. [Circular reporting — 循环引用的定义与维基百科被媒体反向引用的案例](https://en.wikipedia.org/wiki/Circular_reporting)
5. [Cochrane Handbook Chapter 5: Collecting data — 数据提取单位需细于文献本身](https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-05)

---

原文：https://pangzhengboyin.com/articles/turn-sources-into-evidence-table-5fd1346a

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
