很多人的第一反应是:既然 AI 能写,那就把题目丢给它。输入一句“帮我写一篇关于××的调研报告”,几秒钟后就拿到一份结构完整、小标题工整、语气专业的稿子。看起来省下的是好几天。

真正的麻烦藏在后面:这份稿子写得越顺,你越难发现哪里是编的。

它不是在查资料,而是在接着往下猜

要理解这件事,得先弄清大语言模型到底在做什么。它不是一个数据库,也不是一个检索系统。Walters 和 Wilder 在评估 ChatGPT 引用质量的那篇论文里有一句很准确的说法:ChatGPT 根本上是语言处理工具,不是信息处理工具,它模仿的是文本的样子,而不一定是文本里的实质内容。1

具体来说,它做的事是:给定前文,预测接下来最可能出现的一段文字。这个机制在写过渡句、把三点并列起来、给一段结论收尾这类任务上表现极好,因为这类文字在训练数据里出现过千千万万次,模式稳定。但对“这个细分行业去年的出货量到底是多少”这种问题,它并没有去查,它生成的只是一个“统计数字通常长这样”的句子。

研究者把这种现象叫幻觉(hallucination):内容读起来连贯、格式正确,但和事实不符。

伪造文献的比例比想象中高

这类问题在多份评估里被量化过,而文献引用恰好是最容易核查、也最容易露馅的一类。

《Scientific Reports》上的一项研究让 ChatGPT-3.5 和 ChatGPT-4 就 42 个跨学科题目写短文献综述,共得到 84 篇文本、636 条引用,然后逐条去数据库核对。结果是:GPT-3.5 引用的文献里 55% 根本不存在,GPT-4 降到 18%;在那些真实存在的文献里,GPT-3.5 有 43%、GPT-4 有 24% 含有实质性错误,比如作者、年份、卷期页码对不上。1

另一项针对医学内容的研究更直接:115 条引用里 47% 是伪造的,46% 真实但有错误,只有 7% 既真实又准确。3

最值得记住的还不是比例,而是模型被追问时的反应。有研究在发现某条引用查不到之后,直接告诉 ChatGPT“这条文献找不到”,得到的回应是:模型诚恳道歉,坚持这条文献存在,然后给出一个新的 DOI 或网址——同样不存在。2

这就是为什么“AI 一本正经胡说”不是偶发的 bug,而是这类工具在没有事实可依据时仍然照常输出的必然结果。模型版本在进步,但这个问题只是变小,没有消失:同一批文本里,GPT-4 引用书章节时的伪造率仍达 70%。1

风险分布并不平均,恰恰集中在你看不懂的地方

值得再往前推一步:同一个模型,为什么有些稿子能用,有些不能用?

差别在于这个题目有多少落在模型的知识边界之外。热门话题、被反复写过几十年的内容,训练数据里到处都是,模型即使“记不清”,也大概率能写个八九不离十。冷门的细分领域、最新的数据、行业内部资料、你自己公司的业务情况,这些内容在训练数据里稀薄甚至没有,任务越往这个方向走,模型越只能靠“合理的措辞”填空。

更麻烦的是:你对这个领域了解越少,就越难发现它在填空。你唯一能判断的是“读起来顺不顺”,而顺不顺恰好是它最擅长的事。判断力不足的地方,AI 的输出会显得最漂亮。

先把材料放进去,任务性质就变了

研究的价值有一半在于喂给 AI,另一半在于喂给你自己。

先说喂给 AI 这部分。当你手里已经有几份真实材料——报告、访谈记录、后台数据、已发表的论文——把它们连同题目一起交给模型,并明确要求:只根据这些材料写,每个结论后面标出它来自哪份材料,材料里没有的信息不要补充。

这时模型的任务从“回忆”变成了“转写和重组”。它不需要知道那个数字是多少,它只需要看得见那个数字,然后把它安排到合适的位置。这种做法在研究和工程里叫 grounding(有据生成):把相关材料放进模型的上下文,让它依据眼前的材料生成,而不是依据参数里模糊的记忆。RAG(检索增强生成)就是把“先检索、再生成”做成系统流程的一类做法,4 而只把文档贴进对话窗口、不改动模型的简化版本,效果同样明显。5

有一条结论对实际操作特别重要:在一项关于长文生成的研究里,输出内容的有据程度主要取决于喂进去的信息,而不太取决于提示词怎么措辞。6

这对反复打磨提示词的人是个提醒:与其把指令改到第十版,不如多找一份靠谱的一手材料。

但“材料在前”也不是万能的

边界必须说清楚,否则等于换了一种迷信。

材料给到模型之后,仍然有两种典型失败。第一种是缺料:材料里没有回答某个问题的依据,模型未必会停下来告诉你“这里没依据”,而可能顺着自己原有印象把这一段补完。第二种是材料互相矛盾:模型未必会把冲突摆出来,而可能只顺着其中一份往下写。7

对应的操作也很简单:在指令里给它一个“材料不足”的出口,明确说“如果材料里找不到依据,就写‘材料中未提及’,不要推测”。这个动作被验证过——把无法回答的问题明确标出来,能明显减少无依据的输出。6

研究在前真正买回来的两样东西

第一样是可核查性。稿子里的每个结论都能对应到你手上某一份材料,核对就变成逐条对账,而不是从头再查一遍。你手里有原始材料,才有能力判断某句话是“材料支持”还是“模型补的”。

第二样,也是更根本的一样:你自己的判断标准。把关有个前提——手边得有一份不依赖 AI 的参照物。没有它,你只能判断文字是否通顺;有了它,你才能判断内容是否成立。研究这一步看着是在给 AI 准备素材,实际上是在给你自己准备判断依据。

所以“先研究再动笔”不是一种更慢的做法,而是先把成本花在能产生判断力的那一步。跳过这一步,省下的时间会以另一种形式还回来:稿子交出去之前你心里没底,出了问题之后你也不知道该从哪里查起。

落实到动作上,顺序大致是:

  • 先写下这篇材料要回答的三到五个具体问题。是问题决定你要找什么,而不是反过来。
  • 找一手材料,边找边摘录,每条摘录旁边记两件事:出处,以及它支撑哪个问题的哪一句结论。
  • 拿到初稿后逐条对账,凡是标不出出处、或者对不上原材料的句子,要么删掉,要么去找材料补上。

这套顺序里最重要的不是哪一句指令,而是第二步能不能老实做。有了第二步,后面两步才有东西可依据。