上一篇讲清了为什么不能把题目直接丢给 AI:模型在你不知道的领域照样输出通顺的文字。结论是先把材料攒在前面。可“攒材料”听起来仍然是一个大动作——具体今天该做什么?答案是先写出一份清单,再让 AI 照着清单去跑。

为什么不能直接问“帮我查一下这个行业”

一份材料要下的结论,几乎从来不是单个事实。比如你写一份“要不要把客服继续外包”的建议,它依赖的是一串分散的事实:现在外包一年多少钱、自建同样规模大概要多少人、招聘周期多长、同行怎么选、有没有人自建之后又切回去。研究里把这类问题叫 多跳问题:答案不落在任何一份材料里,而是散在多份材料之间,需要跨来源拼起来。

把这种问题整句丢给模型或搜索引擎,检索到的那一两段通常只覆盖其中一环。模型手上的证据是残缺的,它不会停下来告诉你缺了哪一环,而是把剩下的部分用“合理的措辞”补完。有研究比较过拆与不拆:把复杂问题先拆成若干子问题分别检索、再合并候选材料,能捞到更互补的证据,最终答案也更准。1 这说的是“拆开之后更容易凑齐证据”,不是说拆开就一定正确。

还有一个更实际的理由:宽问题的答案你没法判真假。“这个行业前景如何”这种问题,答得对不对都读得通,你唯一能判断的是语气顺不顺——而语气顺恰好是 AI 最强的地方。反过来,“2024 年这个细分市场的出货量是多少、单位是台还是金额、统计口径含不含出口”这种问题,答案要么对要么错,你可以拿它跟一份原始报告对。

所以拆题不是为了把活干得更细,而是为了把一批 无法判断真假的问题 换成一批 可以判断真假的问题。这是整条流水线上最关键的一次转换。

拆到什么颗粒度

系统综述这套成熟流程里有个说法可以直接借:一个过宽的问题,应当拆成一组互相相关的、更具体的问题;问题里的关键要素——对象是谁、范围多大、时间区间、跟什么比较、看哪个指标——要定义清楚,但不要求每个要素都同样精确。23

落到写材料上,一条好用的拆法是:先把这篇材料最后要下的那句结论写出来,再把这句话里每一个“必须成立才能这么说”的前提,各写成一个问题。

用一个假想的题目举例。结论想写:“建议客服继续以外包为主,但把工单按复杂度分级处理。”前提就至少有五条:

  • 现在外包的单位成本是多少,过去两年怎么变的?
  • 自建同等规模团队的人力成本区间是多少?
  • 同行里自建和外包各占多少,有没有公开的切换案例和结果?
  • 分级处理能减少多少工单量,这个数字有没有可核对的来源?
  • 有没有反例——自建之后又切回外包的?

五条差不多就够一篇三千字的材料。清单如果超过七八条,通常说明题目本身太大,该先缩小范围,而不是硬拆下去。

每条问题还必须自带 口径。只写“出货量”没用,要写清哪一年、什么单位、哪个地区、含不含出口。原因很直接:模型和大多数二手资料都会给你一个数字,但不会自动提醒你它的口径和你要的不是一回事。把口径写进问题里,答案错了你才看得出来。

还有一条自查标准:每条问题都要能想象出答案的形状——一个数字、一个日期、一个机构名、一段可引用的原话,或者“没有公开数据”。想象不出形状的,多半还不是一个能查的问题。

“附出处”是三个条件,不是一个链接

这是最容易偷懒的一步。现在的 AI 工具基本都会自动给引用,看上去已经“有出处”了。

但“有引用”和“可核对”是两回事。哥伦比亚大学 Tow Center 在 2025 年测了八个带实时搜索能力的生成式工具(ChatGPT Search、Perplexity、Copilot、Gemini、Grok 等),用 200 条包含新闻原文片段的查询让它们指出来源,整体上超过 60% 的查询答错;Grok 3 有 94% 答错;Gemini 和 Grok 3 有超过一半的回答给出的是伪造的或打不开的链接;DeepSeek 在 200 次里有 115 次把内容归给了错误的来源。4

另一项对生成式搜索引擎的评估结论类似:平均只有 51.5% 的生成句子有引用支持,只有 74.5% 的引用真正支持它旁边那句话。5 再一项对三个答案引擎的自动评测里,引用准确率落在 49% 到 68% 之间,而“这句话确实需要这个来源”的比例只有 50% 到 69%。6

这些数字合起来说明一件事:AI 给出的引用链接本身也是一种“看起来很完整的文字”,同样会被编出来。所以清单里提出处要求时,不能只要一个链接,要三个条件同时满足:

  1. 链接能打开,而且指向原始出处,不是转载版本——测试里把转载版本当成原出处的情况很常见;
  2. 出处原文里确实有那句话,最好要求它把原话摘录贴回来;
  3. 那句话支撑的正是清单里的 这一条,而不是看着相关、实际答的是另一个问题。

三条缺任何一条,这条就只能算“未核实”。对应的指令可以写得直白些:如果没读到原文,就写“未查到”,不许用相似的说法替代。

再补一条操作细节:逐条查,不要一次把五个问题一起丢过去。分开提问,你才知道哪条答上了、哪条空着;五个问题混在一起,模型会把它们整合成一段流畅的文字,中间哪一环是它补的,你分不出来。分开查还有个附带好处:不会把 A 材料里的数字错接到 B 结论上。

把它们整理成一张能继续补的表

资料框架不需要复杂。一张表,按问题分行就够:

待查问题目前的答案依据(原话摘录)出处(可点击)口径与日期还缺什么

按 问题 分行,而不是按材料分行,这一点值得强调。按材料记录(一份报告一条笔记)读起来像读书笔记,写的时候还得重新翻找;按问题分,动笔时直接往下抄,哪一行是空的你一眼就看得见。图情领域把这类表叫综合矩阵,做法几十年没变:一行一个问题或一份材料,一列一个要素。7

“还缺什么”这一列是本文最希望你保留下来的设计。因为拆清单真正的收益不在于多找到几份材料,而在于你明确知道 哪里没有材料。第五行的原话摘录空着,你就知道这一段要么去补,要么在文里写成“目前没有公开数据”,而不是让 AI 替你圆过去。

收工的标准也随之变得清楚:清单上每一条,要么有一行出处能点开、能对到原话;要么明确记成“未查到”。后者不是失败,它本身就是一条结论。

交给下一步

走到这里,你手上有两样东西:一堆排好序的问题,和一张每行都拴着出处的表。接下来才轮到动笔——先用这张表搭提纲,再一句一句让 AI 按表里的依据写。至于“材料明明给了,为什么它还在某一段自己发挥”,以及“怎么让它在没依据时停下来”,那是下一步要处理的问题。

一句话收尾:让 AI 找资料的第一步不是打开 AI,而是先写出一份自己看得懂的清单。清单长什么样,你最后拿到的东西就是什么样。