# 让 AI 读长文：别问“帮我总结一下”，带着问题去读

为什么通用摘要没法用，以及怎样先摘原文、再带具体问题提问，拿到能直接用的要点

> 长文阅读 · 提示词实践 · 验证成本 · 约 7 分钟 · 09 月 26 日

## 本篇要点

1. “帮我总结一下”之所以没用，是因为摘要的本质是决定丢掉哪些内容，而你没指定时它就按一般重要性替你决定，产出的概述没有任何可用接口。
2. 一段概述的检查成本等于自己读一遍原文，所以它不满足“能便宜地检查”这个前提；这个判据决定了长文摘要只在“判断要不要亲自读”时够用。
3. 长文的位置实验显示，同一段关键信息放在输入中间时模型表现明显变差，放在开头或结尾最好；另有评测发现输入越长表现越不稳定，问题与原文措辞差得越远掉得越快。
4. 这些效应并非在所有较新模型上都被复现，因此结论不是“模型读不了长文”，而是你无法从外部判断关键信息有没有被它用上。
5. 可用的读法是三步：先让它只摘原文、标明出处；再让它基于引文回答你自己的具体问题，并单独列出材料未提及项；最后回原文抽检两三条引文。
6. 让模型单独列出“材料未提及”的条目，是让遗漏从静默变成可见的关键一步。
7. 要求放最末尾、长材料放前面，能让它在开始回答前刚看过你的要求；官方测试中这一改动最多带来三成质量提升。

---

前两篇各解决了一个问题：先用“能不能便宜地检查”决定哪些活该交出去，再用指令的几个部件把返工往前提。现在到第一个真正常用的场景——手上有几十页报告、合同或者会议材料，你不想从头读完，想让它替你读。

先看一个几乎每个人都试过的写法：

> 帮我总结一下这份文档。

你会拿到一段没有错误、也没有用处的概述。这篇要讲的就是它为什么必然没用，以及换成什么问法才能拿到能直接用的材料。

## 摘要的本质是丢东西，而你没指定丢什么

一份 30 页的报告压成 500 字，扔掉了九成以上的内容。这份摘要唯一起作用的决定，就是扔掉哪些。

你没指定，它就按“一般重要性”来扔：背景一句、要点几句、结论一句、风险一句。这份概述通常不会错得离谱，问题是它没有接口——你想拿它写方案，它没告诉你有哪句话能当依据；你想判断这份合同要不要签，它没说哪条条款对你不利。

更麻烦的是检查成本。上一篇给过的判据在这里又用上了：一件活值不值得交出去，看你能不能便宜地检查结果。一段通用概述怎么检查？“看着挺全的。”真想确认它有没有漏掉关键条款，你只能把合同从头读一遍——检查成本等于自己重做，净收益归零。

## 长文档还有第二个麻烦：它不是均匀地被读进去的

这一点决定了“让它自己判断哪句重要”为什么不可靠。

2023 年的一项研究把同一段包含答案的材料放在长输入的不同位置，测模型的答题表现，得到了一条 U 形曲线：材料在开头或结尾时成绩最好，放在中间时明显变差。当时测到的极端情况是，答案所在的文档被埋进 20 份文档中间时，答题成绩甚至低过不给任何文档、只凭记忆回答 [2]。2025 年另一组更细的评测发现，即使任务本身很简单，输入越长，模型的表现越不稳定；而且你问的话和材料里的措辞差得越远，掉得越快 [3]。还有一篇论文做了更严格的对照：就算模型能一字不差地把相关段落找出来，仅仅因为输入变长，最终答案的正确率也会明显下降 [4]。

这些结论并没有被所有实验复现——也有较新的对照实验在十几万 token 的长度上没测出这种衰减 [6]。所以别读成“模型读不了长文”。稳定的实践含义是另一层：**你从外部无法知道你要的那句话，在它眼里算重要信息还是噪音。** 它读到了，可能没用好；它没读到，输出照样写得自信。既然“哪句重要”这个判断收不回来，就不要把它交给对方。

## 把它拆成三个你能核对的动作

换成带具体问题的读法，核心是让“读长文”这件事从一个动作变成三步。

### 第一步：先摘原文，不要它下结论

把文档放进分隔符里，只要一件产出：

```
把下面这份合同放在 <合同> 标签里。
先只做一件事：把所有涉及付款、交付时间和违约责任的条款，
逐条摘出原文，标明条款编号。
不要改写，不要总结，不要评论。

<合同>
（粘贴全文）
</合同>
```

这一步的原理是：**把“判断”换成“抄写”。** 抄错最容易发现——把摘出的句子和原文对一遍就知道。它同时把后面的工作压在了真实文本上：下一轮的结论必须从这些引文里长出来，而不是从它对整份文件的模糊印象里长出来。

Anthropic 的官方指南把这一招写成“先让模型引用相关原文，再执行任务”，理由正是引文能帮它穿过文档里大量的无关内容；他们自己的长文实验也发现，先摘引文再作答在所有对比里都更有帮助，代价只是一点点延迟 [1][5]。

### 第二步：基于引文回答你的问题

```
基于上面摘出的条款，回答三个问题：
1. 付款分几期，每期的比例和触发条件分别是什么？
2. 从签约到全部交付，最晚到哪一天？
3. 哪些条款会让我们额外花钱或担责？逐条给出条款编号和原句。

材料里没有提到的，单独列在“材料未提及”下面，不要推测。
```

三个问题都是你能亲自判断对错的——这一条比什么都重要。写问题的时候，你心里要已经有一个“答对了长什么样”。

最后那句“材料未提及”是整段里最有用的一行。**它把“它漏了什么”变成一个你看得见的空行。** 没有这一项，遗漏是完全静默的：它不写，你也不知道原文里本来有。

### 第三步：回原文抽检

挑看起来最要紧的两三条，按条款编号或原句去原文核对一遍。这不是不信任，是成本核算：核对三条引文花两分钟，读完三十页合同花两小时。前两步的全部意义，就是让检查缩到这两分钟。

## 问题怎么写才算“具体”

“总结一下签约风险”不算具体，因为它没告诉你答对了是什么样。换成带上具体名词、金额、日期、条号的问法：

- 哪些条款要求我们提前 30 天通知？没按时通知的后果是什么？
- 材料里给出的三个数字之间是加减关系还是各自独立的？原句分别在哪一节？

一次问三到五个，每个都是你能判对错的。同时要求它在每条结论后面带上出处——条款编号、页码、小标题都行。带出处本身就是检查手段：想核对你能直接跳过去；如果是编的，出处往往对不上。

如果你连自己想知道什么都不确定，那就先要一份带小标题和页码的目录式概览，用它来定第二步该问什么。这份概览是跳板，不是结论。

## 材料放前面，问题放最后

这是个位置问题，几秒钟就能改。Anthropic 的长文指南建议：把长文档放在提示的开头，你的问题和要求放在文档之后；他们在测试里看到，问题放在结尾能把回答质量提升最多 30% [1]。

机制不神秘。模型是一个词一个词往外写的，写每个词的时候只能“看”它前面已经出现的内容。要求放在最末尾，等于它先读完几十页材料，紧接着看到你的问题，然后马上开始回答；要求夹在材料中间或者写在最前面，轮到它写答案时，中间已经隔了几十页文字，要求被推远了。他们自己的长文实验里也注意到，一旦为了放示例而把问题推离文档末尾，靠近结尾那部分内容的召回反而会变差 [5]。

多份材料的情况，再补一条：每份用标签分开并编号，问的时候用编号或文件名指代，并要求它说明每条信息来自哪一份 [1]。

## 什么时候“帮我总结一下”是够用的

有一种情况它完全够用：你只是想知道**这份材料要不要我亲自读**。这时你的判断成本极低——扫一眼概述，几秒钟就能定“值得读”或“不值得读”。

所以分界线还是第一篇那个判据：能不能便宜地检查。概述不是不能用，是只能用在检查便宜的场景里。一旦你打算拿摘要去写方案、做决定、对外发出去，就必须带问题——因为那时你检查的对象已经从“值不值得读”变成了“它有没有说错”。

一个边界：材料越长，能保留下来的细节越少。真到几百页的规模，就不能再指望一次丢进去了，那属于下一篇的范围。

## 术语表

- 长文位置效应（lost in the middle）：同一段关键信息放在长输入的中间，比放在开头或结尾更容易被模型忽略，性能呈 U 形曲线。
- 上下文长度衰减（context rot）：输入变长本身就会让模型表现更不稳定，即使它能正确找出相关段落。
- 先引后答：先让模型摘出原文片段并标明出处，再基于这些片段作答，把“判断”换成容易核对的“抄写”。
- 材料未提及清单：要求模型把文档里找不到答案的问题单独列出，使遗漏可见，避免用推测填空。
- 提示中的位置安排：长材料放前面、要求放最后，让模型在开始回答前刚刚看过你的要求。

## 来源

1. [Anthropic 官方提示指南：长文档放前面、问题放结尾（测试中最多提升 30%）、多文档用标签分隔并编号、先引用原文再执行任务](https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices)
2. [Lost in the Middle：关键信息在长输入中的位置导致 U 形性能曲线，中间最差，最坏情况不如不给文档](https://arxiv.org/abs/2307.03172)
3. [Chroma 的 Context Rot 评测：18 个模型上输入越长表现越不稳定，问题与材料措辞相似度越低衰减越快](https://www.trychroma.com/research/context-rot)
4. [Context Length Alone Hurts LLM Performance Despite Perfect Retrieval：即使能完美检索到全部相关证据，仅输入变长本身也会让成绩明显下降](https://aclanthology.org/anthology-files/pdf/findings/2025.findings-emnlp.1264.pdf)
5. [Anthropic 长文提示实验：把相关引文摘进 scratchpad 在各项对比中都有帮助，并要求把指令放在提示末尾](https://www.anthropic.com/research/prompting-long-context)
6. [预印本（尚未同行评议）：在四个较新模型上、最多 15 万 token 的受控测试中没有测出随长度衰减，提示上述效应并非普遍复现](https://doi.org/10.5281/zenodo.20753848)

---

原文：https://pangzhengboyin.com/articles/reading-long-documents-with-ai-d3f903fd

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
