先别学提示词,先回答“该不该它做”

很多人第一次认真用 AI 办公,是从搜“万能提示词模板”开始的。用了几句,发现有的效果不错,有的来回改四五遍还不如自己写,于是慢慢又不用了。

问题常常不出在提示词上,而出在更前面一步:这件事本来就不该交给它。同一句提示词,用在对的任务上是一键完成,用在错的任务上就是白折腾。所以第一步要做的不是学技巧,而是把你一周里反复出现的办公事务摊开,判断每一项该放在哪个位置,画出一张属于你自己的 AI 工作地图。

第一步:把一周摊成一张动作清单

不用做得很正式。找一个安静的二十分钟,回忆上一周,把每天做过的事写下来。关键有两点。

用动词开头,写到动作的颗粒度,而不是职位名称。“写周报”太粗,没法判断;“把五个项目群里的进度消息摘出来,按模板拼成一份周报”才是能判断的动作。同样,“做表”要写成“把销售和库存两张表按产品编号合并,算出缺口”。

每条后面标三样东西:多久发生一次、每次大概花多久、做完给谁看。第三条尤其重要,因为“给谁看”直接关系到出错的后果。

一份普通的清单可能长这样:

  • 每周五拼周报,1 小时,给直属领导看
  • 每周一开例会,会后整理纪要,30 分钟,发给全组
  • 每天把三张表合并、去重,20 分钟,自己用来做判断
  • 领导临时要的方案初稿,每月一两次,2 小时,会往上传
  • 英文邮件翻译、改语气,每天几封,5 分钟,对外发出

这一步完全不用考虑 AI,只是把工作从脑子里搬到纸上。

为什么不能凭感觉挑

清单写好了,自然会想:哪些能交给 AI?凭直觉挑最容易出错,原因有两个。

第一,AI 的能力是“锯齿状”的。 哈佛商学院和波士顿咨询(BCG)合作做过一次实验,758 名顾问随机分成用 AI 和不用 AI 两组,做 18 个真实的咨询任务。用 AI 的一组平均多完成 12.2% 的任务、速度快 25.1%,成果质量高出 40% 以上 1。但研究者另外设计了一个被认为“在 AI 能力边界之外”的复杂管理任务,结果用 AI 的顾问给出正确答案的比例反而低了 19 个百分点 1。

注意这里的反差:两组任务从表面看难度差不多,都像“AI 应该能干”的知识工作,结果一个在边界内、一个在边界外。论文把这种现象叫“锯齿状前沿”——同样的工作流里,相邻的两步可能一步 AI 特别擅长,另一步特别容易出错,而且分界线在哪,连有经验的老手也看不出来 1。所以“这个挺难的,AI 应该不行”和“这个看着简单,AI 肯定行”两种判断都不可靠。

第二,AI 做得快,不等于你用着省。 这是下面要讲的核心理由。

真正该问的问题:我能不能便宜地检查

Andrej Karpathy 总结过一条区分标准:传统软件自动化的是“你能明确规定的东西”,而这一代大语言模型自动化的是“你能验证的东西” 2。原因在于模型是怎么训练的——它们在有明确对错信号的领域(数学题、能跑通的代码)被反复练习,进步极快;在没有自动对错信号的领域(判断、策略、需要真实世界常识的事),就明显粗糙 2。这就是“锯齿”的来源。

这条标准翻译成上班族的语言就是:判断一件事能不能交给 AI,先别问它会不会做,先问你能不能很快确认它做对了。

检查要花的时间,可以叫“验证税”。一项任务交给 AI 的实际收益是:

净收益=省下的时间−检查的时间\text{净收益}=\text{省下的时间}-\text{检查的时间}

如果检查只需要十几秒扫一眼,收益就很大;如果检查意味着把活重做一遍,那交给 AI 就是净亏。

看几个具体例子。

划算的:把三张表按产品编号合并、去重——行数对不对、重名还在不在,肉眼几秒钟看得出来;会议录音转成纪要草稿——你本人在场,扫一遍就知道哪句记错了;英文邮件改语气——你清楚自己想说什么,能立刻判断有没有跑偏。

不划算的:让 AI 汇总一份你完全没读过的行业报告,然后拿它去汇报。要确认它没编内容,你得把原文读一遍——检查的成本约等于本来该做的阅读,甚至更高。同样,让 AI 算一个你自己没把握口径的数字,你得重算一遍才敢用。

这里还有一个容易被忽略的变量:检查成本也取决于你懂不懂。 同一份材料,懂行的人扫一眼就看出问题,不懂的人根本没法判断。所以“我不懂,所以让 AI 做”往往是所有组合里最危险的一种。

另一个陷阱是:反复成功会让你放松警惕。同一个任务用顺了几次之后,人会下意识地跳过检查,而模型出错的概率并没有因此下降——出错率没变,变浅的是你的检查 3。所以检查这一栏的强度,最好按“每次都查”固定下来,而不是靠当天的信任感决定。

三个问题,把清单分成三区

回到你的清单,逐条问三件事:

  1. 做错了会怎样? 顶多返工,还是会影响钱、客户、对外发布、领导的决策依据?
  2. 我能多快确认它对不对? 十几秒能看出来,还是要逐条核对,还是根本没法判断?
  3. 把要求说清楚,会不会比我自己做还久? 如果需要向 AI 解释四十分钟才能省下二十分钟,那这笔账不用算。
绘制中

A 区:直接交给 AI 产出。 格式整理、多表合并、分类打标、常规通知的初稿、翻译初稿。这类任务出错代价小,而且对错一眼可见。

B 区:AI 起草,我把关发出去。 周报、方案初稿、邮件、汇报提纲——中间那段“拼装、复述、排版”交出去,最后的判断和署名留给自己。判断一个任务是不是属于这一区,可以看几条特征:输入有两份以上、产出是一份要交给别人的文件、会重复做、你本来就清楚“做得好的样子”长什么样、而且中间过程恰好是最无聊的那段——同时满足越多,越值得交出去 4。普通上班族收益最大的区域通常就在这里。

C 区:自己做,AI 只做外围。 定调子和取舍、跟人谈、需要你承担责任的事,以及你自己还没想清楚要什么的事(你先把“要什么”想清楚,AI 才知道该干什么)。AI 可以帮你在动手前把材料摊好、在完成后挑毛病,但动作本身是你的。

把周报再走一遍:输入是五个项目群的进度消息,输出是一份文档,每周五重复,你知道好周报长什么样,中间“摘录加拼装”最无聊——几条特征全中,稳稳落在 B 区。

画完之后的两条注记

这张图会移动。 今天在 C 区的任务,模型变强、或者你把标准写清楚之后,半年后可能就进了 B 区;同一个任务,你做熟了、判断变快,也可能从 B 区挪进 A 区。每隔三四个月重看一次就够了。

先只挑一件跑起来。 一次挑三件,通常三件都半途而废。挑“每周都做、检查最快”的那一件,先跑两周,再回头改地图。至于提示词怎么写,那是下一步的事——只有地图画出来,你才知道值得为哪几步认真写它。