# 从一个大问题到一份待查清单：让 AI 找资料的第一步怎么走

把宽泛的题目拆成口径明确、能判断真假的问题，再要求每条答案都附上可核对的出处

> 资料整理 · AI 引用可靠性 · 研究问题拆解 · 约 7 分钟 · 09 月 30 日

## 本篇要点

1. 宽泛的问题（如“这个行业前景如何”）无法判断真假，拆成口径明确的具体问题后，答案才有对错可言，这一步的价值是把不可核查的问题换成可核查的问题。
2. 一份材料的结论往往依赖散在多份来源里的事实，整体丢给模型会只覆盖其中一环，剩下的被模型自行补完；有研究显示先拆成子问题分别检索能提高证据覆盖度，但这说明的是更容易凑齐证据，不等于拆开就一定正确。
3. 拆题的实用方法是从最终要下的结论倒推：把这句话每个“必须成立才敢这么说”的前提各写成一个问题，通常五到七条即可，超过说明题目太大。
4. 每条问题要写清口径（年份、单位、地区、比较对象），因为模型和二手资料都不会主动提醒你口径不一致；每条还要能想象出答案的形状（数字、日期、机构名、原话或“没有公开数据”）。
5. “附出处”必须同时满足三个条件：链接能打开且指向原始出处、原文里确有那句话、那句话支撑的正是这一条问题；只给链接不算核实。
6. 生成式搜索工具的引用本身就常出错：一项 2025 年的测试中八个工具整体超过 60% 的查询答错，部分工具一半以上回答给出的是伪造或失效链接，另有研究测得平均仅 51.5% 的句子有引用支持。
7. 应当逐条提问而不是一次问五个，这样才能分辨哪条查到了、哪条是空白，也避免把一份材料的数字错接到另一条结论上。
8. 资料框架按问题分行（而非按材料分行），每行含答案、原话摘录、可点击出处、口径和“还缺什么”；缺口标出的空白本身就是结论之一。
9. 收工标准是每条问题要么有一条可点开、可对到原话的出处，要么明确记成“未查到”。

---

上一篇讲清了为什么不能把题目直接丢给 AI：模型在你不知道的领域照样输出通顺的文字。结论是先把材料攒在前面。可“攒材料”听起来仍然是一个大动作——具体今天该做什么？答案是先写出一份清单，再让 AI 照着清单去跑。

## 为什么不能直接问“帮我查一下这个行业”

一份材料要下的结论，几乎从来不是单个事实。比如你写一份“要不要把客服继续外包”的建议，它依赖的是一串分散的事实：现在外包一年多少钱、自建同样规模大概要多少人、招聘周期多长、同行怎么选、有没有人自建之后又切回去。研究里把这类问题叫**多跳问题**：答案不落在任何一份材料里，而是散在多份材料之间，需要跨来源拼起来。

把这种问题整句丢给模型或搜索引擎，检索到的那一两段通常只覆盖其中一环。模型手上的证据是残缺的，它不会停下来告诉你缺了哪一环，而是把剩下的部分用“合理的措辞”补完。有研究比较过拆与不拆：把复杂问题先拆成若干子问题分别检索、再合并候选材料，能捞到更互补的证据，最终答案也更准。[1] 这说的是“拆开之后更容易凑齐证据”，不是说拆开就一定正确。

还有一个更实际的理由：宽问题的答案你没法判真假。“这个行业前景如何”这种问题，答得对不对都读得通，你唯一能判断的是语气顺不顺——而语气顺恰好是 AI 最强的地方。反过来，“2024 年这个细分市场的出货量是多少、单位是台还是金额、统计口径含不含出口”这种问题，答案要么对要么错，你可以拿它跟一份原始报告对。

所以拆题不是为了把活干得更细，而是为了把一批**无法判断真假的问题**换成一批**可以判断真假的问题**。这是整条流水线上最关键的一次转换。

## 拆到什么颗粒度

系统综述这套成熟流程里有个说法可以直接借：一个过宽的问题，应当拆成一组互相相关的、更具体的问题；问题里的关键要素——对象是谁、范围多大、时间区间、跟什么比较、看哪个指标——要定义清楚，但不要求每个要素都同样精确。[2][3]

落到写材料上，一条好用的拆法是：先把这篇材料最后要下的那句结论写出来，再把这句话里每一个“必须成立才能这么说”的前提，各写成一个问题。

用一个假想的题目举例。结论想写：“建议客服继续以外包为主，但把工单按复杂度分级处理。”前提就至少有五条：

- 现在外包的单位成本是多少，过去两年怎么变的？
- 自建同等规模团队的人力成本区间是多少？
- 同行里自建和外包各占多少，有没有公开的切换案例和结果？
- 分级处理能减少多少工单量，这个数字有没有可核对的来源？
- 有没有反例——自建之后又切回外包的？

五条差不多就够一篇三千字的材料。清单如果超过七八条，通常说明题目本身太大，该先缩小范围，而不是硬拆下去。

每条问题还必须自带**口径**。只写“出货量”没用，要写清哪一年、什么单位、哪个地区、含不含出口。原因很直接：模型和大多数二手资料都会给你一个数字，但不会自动提醒你它的口径和你要的不是一回事。把口径写进问题里，答案错了你才看得出来。

还有一条自查标准：每条问题都要能想象出答案的形状——一个数字、一个日期、一个机构名、一段可引用的原话，或者“没有公开数据”。想象不出形状的，多半还不是一个能查的问题。

## “附出处”是三个条件，不是一个链接

这是最容易偷懒的一步。现在的 AI 工具基本都会自动给引用，看上去已经“有出处”了。

但“有引用”和“可核对”是两回事。哥伦比亚大学 Tow Center 在 2025 年测了八个带实时搜索能力的生成式工具（ChatGPT Search、Perplexity、Copilot、Gemini、Grok 等），用 200 条包含新闻原文片段的查询让它们指出来源，整体上超过 60% 的查询答错；Grok 3 有 94% 答错；Gemini 和 Grok 3 有超过一半的回答给出的是伪造的或打不开的链接；DeepSeek 在 200 次里有 115 次把内容归给了错误的来源。[4]

另一项对生成式搜索引擎的评估结论类似：平均只有 51.5% 的生成句子有引用支持，只有 74.5% 的引用真正支持它旁边那句话。[5] 再一项对三个答案引擎的自动评测里，引用准确率落在 49% 到 68% 之间，而“这句话确实需要这个来源”的比例只有 50% 到 69%。[6]

这些数字合起来说明一件事：AI 给出的引用链接本身也是一种“看起来很完整的文字”，同样会被编出来。所以清单里提出处要求时，不能只要一个链接，要三个条件同时满足：

1. 链接能打开，而且指向原始出处，不是转载版本——测试里把转载版本当成原出处的情况很常见；
2. 出处原文里确实有那句话，最好要求它把原话摘录贴回来；
3. 那句话支撑的正是清单里的**这一条**，而不是看着相关、实际答的是另一个问题。

三条缺任何一条，这条就只能算“未核实”。对应的指令可以写得直白些：如果没读到原文，就写“未查到”，不许用相似的说法替代。

再补一条操作细节：逐条查，不要一次把五个问题一起丢过去。分开提问，你才知道哪条答上了、哪条空着；五个问题混在一起，模型会把它们整合成一段流畅的文字，中间哪一环是它补的，你分不出来。分开查还有个附带好处：不会把 A 材料里的数字错接到 B 结论上。

## 把它们整理成一张能继续补的表

资料框架不需要复杂。一张表，按问题分行就够：

| 待查问题 | 目前的答案 | 依据（原话摘录） | 出处（可点击） | 口径与日期 | 还缺什么 |
|---|---|---|---|---|---|

按**问题**分行，而不是按材料分行，这一点值得强调。按材料记录（一份报告一条笔记）读起来像读书笔记，写的时候还得重新翻找；按问题分，动笔时直接往下抄，哪一行是空的你一眼就看得见。图情领域把这类表叫综合矩阵，做法几十年没变：一行一个问题或一份材料，一列一个要素。[7]

“还缺什么”这一列是本文最希望你保留下来的设计。因为拆清单真正的收益不在于多找到几份材料，而在于你明确知道**哪里没有材料**。第五行的原话摘录空着，你就知道这一段要么去补，要么在文里写成“目前没有公开数据”，而不是让 AI 替你圆过去。

收工的标准也随之变得清楚：清单上每一条，要么有一行出处能点开、能对到原话；要么明确记成“未查到”。后者不是失败，它本身就是一条结论。

## 交给下一步

走到这里，你手上有两样东西：一堆排好序的问题，和一张每行都拴着出处的表。接下来才轮到动笔——先用这张表搭提纲，再一句一句让 AI 按表里的依据写。至于“材料明明给了，为什么它还在某一段自己发挥”，以及“怎么让它在没依据时停下来”，那是下一步要处理的问题。

一句话收尾：让 AI 找资料的第一步不是打开 AI，而是先写出一份自己看得懂的清单。清单长什么样，你最后拿到的东西就是什么样。

## 术语表

- 多跳问题：答案不在一份材料里，而是分散在多份材料中、需要跨来源拼起来才能回答的问题。
- 待查清单：把大问题拆成的一组具体、口径明确、能判断真假的问题，是让 AI 找资料时的执行依据。
- 口径：一个数据或结论适用的年份、单位、地区、统计范围等限定条件；口径写进问题里，答案错了才看得出来。
- 出处三条件：链接能打开且指向原始出处、原文里确有那句话、那句话支撑的正是当前这一条问题；三者缺一只能算未核实。
- 资料框架表：按问题分行、一列一个要素的记录表，用来把查到的依据和缺口放在同一张视图里。
- 缺口列：表里记录“这一问题还缺什么”的一栏，让没有材料的空白显式暴露，而不是被流畅的文字遮住。

## 来源

1. [Question Decomposition for Retrieval-Augmented Generation（ACL 2025）— 比较拆分问题与不拆分时的检索覆盖度与答案准确率](https://aclanthology.org/2025.acl-srw.32/)
2. [Cochrane Handbook 第 2 章 — 关于把宽问题拆成一组更具体的问题、定义关键要素与排序](https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-02)
3. [CRD 系统综述指南 — 宽泛问题应拆成一系列更具体的问题并据此构建检索](https://www.york.ac.uk/media/crd/newpagesspring2025/Systematic_Reviews_CRD_guidance.pdf)
4. [Columbia Journalism Review Tow Center — 2025 年对八个带实时搜索的生成式工具的引用准确性测试](https://www.cjr.org/tow_center/we-compared-eight-ai-search-engines-theyre-all-bad-at-citing-news.php)
5. [Evaluating Verifiability in Generative Search Engines — 引用召回 51.5%、引用精度 74.5%](https://ar5iv.labs.arxiv.org/html/2304.09848)
6. [Search Engines in an AI Era — 三个答案引擎的引用准确率与来源必要性等指标](https://arxiv.org/abs/2410.22349)
7. [Queen's University Library — 综合矩阵（synthesis matrix）的结构说明](https://guides.library.queensu.ca/c.php?g=731357&p=5256110)

---

原文：https://pangzhengboyin.com/articles/turn-a-big-question-into-a-research-checklist-b69385de

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
