前两篇各解决了一个问题:先用“能不能便宜地检查”决定哪些活该交出去,再用指令的几个部件把返工往前提。现在到第一个真正常用的场景——手上有几十页报告、合同或者会议材料,你不想从头读完,想让它替你读。

先看一个几乎每个人都试过的写法:

帮我总结一下这份文档。

你会拿到一段没有错误、也没有用处的概述。这篇要讲的就是它为什么必然没用,以及换成什么问法才能拿到能直接用的材料。

摘要的本质是丢东西,而你没指定丢什么

一份 30 页的报告压成 500 字,扔掉了九成以上的内容。这份摘要唯一起作用的决定,就是扔掉哪些。

你没指定,它就按“一般重要性”来扔:背景一句、要点几句、结论一句、风险一句。这份概述通常不会错得离谱,问题是它没有接口——你想拿它写方案,它没告诉你有哪句话能当依据;你想判断这份合同要不要签,它没说哪条条款对你不利。

更麻烦的是检查成本。上一篇给过的判据在这里又用上了:一件活值不值得交出去,看你能不能便宜地检查结果。一段通用概述怎么检查?“看着挺全的。”真想确认它有没有漏掉关键条款,你只能把合同从头读一遍——检查成本等于自己重做,净收益归零。

长文档还有第二个麻烦:它不是均匀地被读进去的

这一点决定了“让它自己判断哪句重要”为什么不可靠。

2023 年的一项研究把同一段包含答案的材料放在长输入的不同位置,测模型的答题表现,得到了一条 U 形曲线:材料在开头或结尾时成绩最好,放在中间时明显变差。当时测到的极端情况是,答案所在的文档被埋进 20 份文档中间时,答题成绩甚至低过不给任何文档、只凭记忆回答 2。2025 年另一组更细的评测发现,即使任务本身很简单,输入越长,模型的表现越不稳定;而且你问的话和材料里的措辞差得越远,掉得越快 3。还有一篇论文做了更严格的对照:就算模型能一字不差地把相关段落找出来,仅仅因为输入变长,最终答案的正确率也会明显下降 4。

这些结论并没有被所有实验复现——也有较新的对照实验在十几万 token 的长度上没测出这种衰减 6。所以别读成“模型读不了长文”。稳定的实践含义是另一层:你从外部无法知道你要的那句话,在它眼里算重要信息还是噪音。 它读到了,可能没用好;它没读到,输出照样写得自信。既然“哪句重要”这个判断收不回来,就不要把它交给对方。

把它拆成三个你能核对的动作

换成带具体问题的读法,核心是让“读长文”这件事从一个动作变成三步。

第一步:先摘原文,不要它下结论

把文档放进分隔符里,只要一件产出:

1把下面这份合同放在 <合同> 标签里。
2先只做一件事:把所有涉及付款、交付时间和违约责任的条款,
3逐条摘出原文,标明条款编号。
4不要改写,不要总结,不要评论。
5
6<合同>
7(粘贴全文)
8</合同>

这一步的原理是:把“判断”换成“抄写”。 抄错最容易发现——把摘出的句子和原文对一遍就知道。它同时把后面的工作压在了真实文本上:下一轮的结论必须从这些引文里长出来,而不是从它对整份文件的模糊印象里长出来。

Anthropic 的官方指南把这一招写成“先让模型引用相关原文,再执行任务”,理由正是引文能帮它穿过文档里大量的无关内容;他们自己的长文实验也发现,先摘引文再作答在所有对比里都更有帮助,代价只是一点点延迟 15。

第二步:基于引文回答你的问题

1基于上面摘出的条款,回答三个问题:
21. 付款分几期,每期的比例和触发条件分别是什么?
32. 从签约到全部交付,最晚到哪一天?
43. 哪些条款会让我们额外花钱或担责?逐条给出条款编号和原句。
5
6材料里没有提到的,单独列在“材料未提及”下面,不要推测。

三个问题都是你能亲自判断对错的——这一条比什么都重要。写问题的时候,你心里要已经有一个“答对了长什么样”。

最后那句“材料未提及”是整段里最有用的一行。它把“它漏了什么”变成一个你看得见的空行。 没有这一项,遗漏是完全静默的:它不写,你也不知道原文里本来有。

第三步:回原文抽检

挑看起来最要紧的两三条,按条款编号或原句去原文核对一遍。这不是不信任,是成本核算:核对三条引文花两分钟,读完三十页合同花两小时。前两步的全部意义,就是让检查缩到这两分钟。

问题怎么写才算“具体”

“总结一下签约风险”不算具体,因为它没告诉你答对了是什么样。换成带上具体名词、金额、日期、条号的问法:

  • 哪些条款要求我们提前 30 天通知?没按时通知的后果是什么?
  • 材料里给出的三个数字之间是加减关系还是各自独立的?原句分别在哪一节?

一次问三到五个,每个都是你能判对错的。同时要求它在每条结论后面带上出处——条款编号、页码、小标题都行。带出处本身就是检查手段:想核对你能直接跳过去;如果是编的,出处往往对不上。

如果你连自己想知道什么都不确定,那就先要一份带小标题和页码的目录式概览,用它来定第二步该问什么。这份概览是跳板,不是结论。

材料放前面,问题放最后

这是个位置问题,几秒钟就能改。Anthropic 的长文指南建议:把长文档放在提示的开头,你的问题和要求放在文档之后;他们在测试里看到,问题放在结尾能把回答质量提升最多 30% 1。

机制不神秘。模型是一个词一个词往外写的,写每个词的时候只能“看”它前面已经出现的内容。要求放在最末尾,等于它先读完几十页材料,紧接着看到你的问题,然后马上开始回答;要求夹在材料中间或者写在最前面,轮到它写答案时,中间已经隔了几十页文字,要求被推远了。他们自己的长文实验里也注意到,一旦为了放示例而把问题推离文档末尾,靠近结尾那部分内容的召回反而会变差 5。

多份材料的情况,再补一条:每份用标签分开并编号,问的时候用编号或文件名指代,并要求它说明每条信息来自哪一份 1。

什么时候“帮我总结一下”是够用的

有一种情况它完全够用:你只是想知道 这份材料要不要我亲自读。这时你的判断成本极低——扫一眼概述,几秒钟就能定“值得读”或“不值得读”。

所以分界线还是第一篇那个判据:能不能便宜地检查。概述不是不能用,是只能用在检查便宜的场景里。一旦你打算拿摘要去写方案、做决定、对外发出去,就必须带问题——因为那时你检查的对象已经从“值不值得读”变成了“它有没有说错”。

一个边界:材料越长,能保留下来的细节越少。真到几百页的规模,就不能再指望一次丢进去了,那属于下一篇的范围。