上一篇收尾时,你手上有两样东西:一份排好序的待查问题清单,和一张每行都拴着出处的表。假设现在材料也攒得差不多了,十几份报告、访谈、行业文章摊在面前。

这时最顺手的动作是:把它们整个丢给 AI,说“帮我综合一下,写成一段结论”。几秒钟后你会拿到一段读起来很像结论的话,开头是“综上所述”,中间是“整体来看”“业内普遍认为”,结尾是“因此建议”。

这段话最大的问题不是它可能编错,而是它丢掉的东西你根本看不出来。这篇文章要解决的,就是在动笔之前多插一步:把每份材料里的说法拆成一条条独立的论据,排成一张能看出 共识、分歧和孤证 的表。这一步做完,你写出来的句子才是“某公司 2024 年的内部数据是……”,而不是“业内普遍认为……”。

“综上所述”丢掉的不是句子,是三样东西

先看一个真实例子。一篇医学论文的原话是:每周一次 0.75 毫克或 1.5 毫克的度拉糖肽,在 26 周内改善血糖控制的效果优于安慰剂,受试者是正在接受或不接受治疗的 2 型糖尿病青少年。2

一个模型把它概括成:度拉糖肽是改善青少年 2 型糖尿病血糖控制的 有效且安全的治疗选择。

每个词都能在原文里找到影子,所以它不像“幻觉”。但剂量没了、对照组没了、26 周这个时间窗没了,“安全”这个词原文根本没测。原文那句是有条件的发现,摘要那句是适用范围宽得多的普遍结论。研究里把这种现象叫 过泛化。

这项研究测了 10 个主流模型、约 4900 份摘要。即便明确要求“忠实原文”,多数模型仍然给出比原文更宽的结论;DeepSeek、ChatGPT-4o、LLaMA 3.3 70B 这几个模型出现这种情况的比例在 26% 到 73% 之间。和人类写的同类摘要比,AI 摘要包含宽泛结论的可能性大约高 5 倍。更反直觉的是:明确要求它“准确、忠实”之后,宽泛结论的几率大约翻倍。2

另一项针对多份文档摘要的评测给出了补充画面:在它的评测口径下,最多 75% 的生成内容被判为幻觉,但这些“幻觉”里真正编造事实的只占 0% 到 9%;人工核对 700 多条之后发现,多数错误的毛病是写得 大而空,或者没按指令做。1

这两项结果拼起来,正好说明“综上所述”的危险在哪:AI 做综合时最典型的失败不是写出假数字,而是写出没有信息量、却读起来像结论的句子。“综上所述,行业整体呈现……”就是这类句子的标准形态。

所以丢掉的到底是哪三样?

  • 条件。哪一年、哪个群体、哪个口径、跟谁比。上面那个例子丢的就是这一整层。
  • 数量与质量。三份材料说 A、一份说 B,这个 3 比 1 本身可能就是假象。
  • 来源。三段话分别出自谁、最早出自哪份东西,被缝进了一句“多数研究认为”。

自己拆,就是把这三位留住。

拆的单位是“说法”,不是“材料”

系统综述这套成熟流程里有个细节值得抄:一份报告可能描述多项研究,一项研究又会报出多个结果,所以提取数据的单位要选得比“文献”更细。5 换成写材料:一篇材料不是一条证据,它是一批说法。

随手打开一篇行业文章,里面通常混着四种句子:

  1. 作者自己测出来或统计出来的数据;
  2. 作者引用别人的数据或结论;
  3. 作者自己的判断和建议;
  4. 背景介绍、定义、铺垫。

只有前两类能直接当论据。第三类不是不能用,但必须标清“这是谁的判断”,它的分量和实测数据不在一个层级上。第四类直接跳过。

那怎么判断一句话该不该拆成一条论据?一个够用的标准是:把年份、对象、单位换掉之后,这句话还成不成立? 如果不成立,那这些条件就是这句话的一部分,必须跟着一起抄下来。用这个标准回头看“度拉糖肽是有效的治疗选择”,换成别的剂量、别的时长都还“成立”,正好说明它的条件已经被丢光了。

具体操作上,一份材料只挑三类句子抄:带数字或日期的、描述具体案例的(谁、什么时候、做了什么、结果如何)、明确下判断的。每条 只抄原话,不做任何改写——改写就是第一次泛化,而第一次泛化往往就发生在你自己手上。

论据表:按“说法”排,不按材料排

接下来是关键动作:把不同材料里 在说同一件事 的论据排到一起。

判断“同一件事”的标准不是用词像,而是把条件写全之后,它们是不是在回答清单上的同一个问题。

表可以长这样(纵向按说法,横向是几个固定列):

清单问题说法支持(材料号+原话)反对口径不一致真实源头实测数据还是作者判断

举个客服外包的例子。材料 A 说某公司外包之后人均客服成本下降了 18%,材料 B 说另一家公司外包之后单位成本上升了。表面看是分歧,但如果 A 算的是纯人力单价、B 算的是含管理费的总成本,这两条就不构成对立——它们落在“口径不一致”这一列。

这一列是整张表里最容易被忽略、也最有用的设计。因为它提醒你:材料之间的矛盾有三种,不是两种。除了“支持”和“反对”,还有大量“其实说的是两件事”,而 AI 做综合时最常做的事,就是把这第三种悄悄按第一种处理掉。

最后一列“真实源头”是为下一节准备的。

共识不能数份数

一旦表里出现几行,人会本能地开始数:三条支持、一条反对,那这条结论就站得住。

在方法学上这有个名字,叫 投票计数:把支持的研究数和反对的研究数比一比,谁多听谁的。Cochrane 手册对这种做法的判断很直接——基于统计显著性的投票计数有严重局限,是不可接受的;它不看样本大小、不看效应大小、不区分研究质量。3 更别扭的一点是,参与计数的小研究越多,这种数法反而越不容易给出正确结论。

放到写材料的场景:一份覆盖全部 200 家门店的内部经营数据,和三家行业媒体你抄我、我抄你的评论文章,不是 1 比 3 的关系。表里支持列有三行,不等于有三份证据。

这就说到了“真实源头”那一列。看起来多个来源,实际上是一个来源,在新闻行业有个老名字:循环引用。维基百科上有个典型例子:有人往条目里写错了一个产品年份,一家主流媒体照抄,随后条目又反过来引用这家媒体,于是错误变得很难删。4

这种链在你的材料堆里比想象中容易出现,尤其是当你把几篇 AI 生成的行业综述也放进来了——它们可能各自都在转述同一份报告。所以论据表里要数的是 独立的原始源头个数,不是文件个数。三份材料都追溯到同一份报告,这一组就是孤证。孤证不等于错,但它只值一份的份量,不能写成“多方印证”。

这一步哪些交给 AI,哪些必须自己留

拆论据是可以让 AI 帮忙的,但要把活拆开。

可以让它做的:

  • 抽取。给每份材料编号,要求“只抄原话,附上位置”,明确禁止改写和概括。
  • 分组。把抽出来的候选论据按“是否在说同一件事”归组,并说明为什么归到一组;同时明确允许它输出“无法归组”。
  • 找口径差异。把同一组论据里条件不一致的地方列出来,交给你判断。

不要让 AI 做的: 判断哪边证据更重、写出“综上所述”。这恰好是它的过泛化倾向发作得最厉害的地方,而且你越是要求它“忠实”,它反而越容易升级结论。2

一个可直接用的输出格式要求是:每条只给五样东西——说法原话、条件(对象·时间·地区·单位)、出处编号、是实测数据还是作者判断、源头是否与其他条目相同。格式定死,它就没多少空间替你把话说圆。

收工前自查两件事:表里有没有“无法归组”的行你没处理;支持列里那几行的“真实源头”是不是同一个。

这张表改变了什么

它带来的收益不是“更全面”,而是让三种原本糊在一起的状态变得分得开:多方独立支持的,可以写成结论;口径不同或结论冲突的,要写明条件再并列;只有孤证的,要么去补,要么在文里明写成“目前只有一份资料提到”。第三种不是失败,它本身就是一条结论——上一篇文章里那句“未查到”留在表上的价值,在这里兑现了。

表填到这一步,你手上的东西已经从“一堆材料”变成了“一组有份量标记的说法”。下一篇要做的,是用这些说法排出一份提纲,再让 AI 按表逐句写——那时它每一次“自己发挥”,你都有地方对照。