# 先画一张自己的 AI 工作地图：哪些办公事务该交给 AI

不学提示词，先判断哪些活该交出去：用“能不能便宜地检查”把一周事务分成三区

> 任务委派 · AI 工作流 · 验证成本 · 约 7 分钟 · 09 月 26 日

## 本篇要点

1. 判断一项办公事务该不该交给 AI，先问“我能不能便宜地确认它做对了”，而不是问“AI 会不会做”。
2. AI 的能力是锯齿状的：BCG 与哈佛商学院的实验里，18 个边界内任务用 AI 后速度快 25.1%、质量高 40% 以上，但另一个看起来难度相近的边界外任务，用 AI 的人给出正确答案的比例反而低 19 个百分点。
3. Karpathy 的标准：传统软件自动化“你能明确规定的东西”，大语言模型自动化“你能验证的东西”，因为模型在有自动对错信号的领域被反复训练，进步最快。
4. 验证税就是检查 AI 产出所花的时间；净收益等于省下的时间减去检查的时间，检查等于重做时交给 AI 就是净亏。
5. 检查成本还取决于你自己懂不懂行，所以“我不懂，所以让 AI 做”往往是最危险的组合；反复成功会让人放松检查，而出错率并没有下降。
6. 做法是先把一周写成动词开头的动作清单，标注频率、耗时、给谁看，再用“出错后果、能否快速确认、描述成本”三个问题把任务分成直接产出、起草把关、自己做三区。
7. 地图会随时间移动；执行时先只挑一件每周重复、检查最快的任务跑起来。

---

## 先别学提示词，先回答“该不该它做”

很多人第一次认真用 AI 办公，是从搜“万能提示词模板”开始的。用了几句，发现有的效果不错，有的来回改四五遍还不如自己写，于是慢慢又不用了。

问题常常不出在提示词上，而出在更前面一步：这件事本来就不该交给它。同一句提示词，用在对的任务上是一键完成，用在错的任务上就是白折腾。所以第一步要做的不是学技巧，而是把你一周里反复出现的办公事务摊开，判断每一项该放在哪个位置，画出一张属于你自己的 AI 工作地图。

## 第一步：把一周摊成一张动作清单

不用做得很正式。找一个安静的二十分钟，回忆上一周，把每天做过的事写下来。关键有两点。

**用动词开头，写到动作的颗粒度，而不是职位名称。**“写周报”太粗，没法判断；“把五个项目群里的进度消息摘出来，按模板拼成一份周报”才是能判断的动作。同样，“做表”要写成“把销售和库存两张表按产品编号合并，算出缺口”。

**每条后面标三样东西**：多久发生一次、每次大概花多久、做完给谁看。第三条尤其重要，因为“给谁看”直接关系到出错的后果。

一份普通的清单可能长这样：

- 每周五拼周报，1 小时，给直属领导看
- 每周一开例会，会后整理纪要，30 分钟，发给全组
- 每天把三张表合并、去重，20 分钟，自己用来做判断
- 领导临时要的方案初稿，每月一两次，2 小时，会往上传
- 英文邮件翻译、改语气，每天几封，5 分钟，对外发出

这一步完全不用考虑 AI，只是把工作从脑子里搬到纸上。

## 为什么不能凭感觉挑

清单写好了，自然会想：哪些能交给 AI？凭直觉挑最容易出错，原因有两个。

**第一，AI 的能力是“锯齿状”的。**哈佛商学院和波士顿咨询（BCG）合作做过一次实验，758 名顾问随机分成用 AI 和不用 AI 两组，做 18 个真实的咨询任务。用 AI 的一组平均多完成 12.2% 的任务、速度快 25.1%，成果质量高出 40% 以上 [1]。但研究者另外设计了一个被认为“在 AI 能力边界之外”的复杂管理任务，结果用 AI 的顾问给出正确答案的比例反而低了 19 个百分点 [1]。

注意这里的反差：两组任务从表面看难度差不多，都像“AI 应该能干”的知识工作，结果一个在边界内、一个在边界外。论文把这种现象叫“锯齿状前沿”——同样的工作流里，相邻的两步可能一步 AI 特别擅长，另一步特别容易出错，而且分界线在哪，连有经验的老手也看不出来 [1]。所以“这个挺难的，AI 应该不行”和“这个看着简单，AI 肯定行”两种判断都不可靠。

**第二，AI 做得快，不等于你用着省。**这是下面要讲的核心理由。

## 真正该问的问题：我能不能便宜地检查

Andrej Karpathy 总结过一条区分标准：传统软件自动化的是“你能明确规定的东西”，而这一代大语言模型自动化的是“你能验证的东西” [2]。原因在于模型是怎么训练的——它们在有明确对错信号的领域（数学题、能跑通的代码）被反复练习，进步极快；在没有自动对错信号的领域（判断、策略、需要真实世界常识的事），就明显粗糙 [2]。这就是“锯齿”的来源。

这条标准翻译成上班族的语言就是：**判断一件事能不能交给 AI，先别问它会不会做，先问你能不能很快确认它做对了。**

检查要花的时间，可以叫“验证税”。一项任务交给 AI 的实际收益是：

$$\text{净收益}=\text{省下的时间}-\text{检查的时间}$$

如果检查只需要十几秒扫一眼，收益就很大；如果检查意味着把活重做一遍，那交给 AI 就是净亏。

看几个具体例子。

**划算的**：把三张表按产品编号合并、去重——行数对不对、重名还在不在，肉眼几秒钟看得出来；会议录音转成纪要草稿——你本人在场，扫一遍就知道哪句记错了；英文邮件改语气——你清楚自己想说什么，能立刻判断有没有跑偏。

**不划算的**：让 AI 汇总一份你完全没读过的行业报告，然后拿它去汇报。要确认它没编内容，你得把原文读一遍——检查的成本约等于本来该做的阅读，甚至更高。同样，让 AI 算一个你自己没把握口径的数字，你得重算一遍才敢用。

这里还有一个容易被忽略的变量：**检查成本也取决于你懂不懂。**同一份材料，懂行的人扫一眼就看出问题，不懂的人根本没法判断。所以“我不懂，所以让 AI 做”往往是所有组合里最危险的一种。

另一个陷阱是：反复成功会让你放松警惕。同一个任务用顺了几次之后，人会下意识地跳过检查，而模型出错的概率并没有因此下降——出错率没变，变浅的是你的检查 [3]。所以检查这一栏的强度，最好按“每次都查”固定下来，而不是靠当天的信任感决定。

## 三个问题，把清单分成三区

回到你的清单，逐条问三件事：

1. **做错了会怎样？** 顶多返工，还是会影响钱、客户、对外发布、领导的决策依据？
2. **我能多快确认它对不对？** 十几秒能看出来，还是要逐条核对，还是根本没法判断？
3. **把要求说清楚，会不会比我自己做还久？** 如果需要向 AI 解释四十分钟才能省下二十分钟，那这笔账不用算。

```mermaid
flowchart LR
  A["一周动作清单"] --> B{"做错了会怎样？"}
  B -->|"顶多返工"| C{"我能多快确认对错？"}
  B -->|"影响钱、客户、对外或决策依据"| G["C 区：自己做，AI 只备料"]
  C -->|"一眼能看出来"| D["A 区：直接交给 AI 产出"]
  C -->|"要逐条核对或没法判断"| E["B 区：AI 起草，我把关"]
```

**A 区：直接交给 AI 产出。** 格式整理、多表合并、分类打标、常规通知的初稿、翻译初稿。这类任务出错代价小，而且对错一眼可见。

**B 区：AI 起草，我把关发出去。** 周报、方案初稿、邮件、汇报提纲——中间那段“拼装、复述、排版”交出去，最后的判断和署名留给自己。判断一个任务是不是属于这一区，可以看几条特征：输入有两份以上、产出是一份要交给别人的文件、会重复做、你本来就清楚“做得好的样子”长什么样、而且中间过程恰好是最无聊的那段——同时满足越多，越值得交出去 [4]。普通上班族收益最大的区域通常就在这里。

**C 区：自己做，AI 只做外围。** 定调子和取舍、跟人谈、需要你承担责任的事，以及你自己还没想清楚要什么的事（你先把“要什么”想清楚，AI 才知道该干什么）。AI 可以帮你在动手前把材料摊好、在完成后挑毛病，但动作本身是你的。

把周报再走一遍：输入是五个项目群的进度消息，输出是一份文档，每周五重复，你知道好周报长什么样，中间“摘录加拼装”最无聊——几条特征全中，稳稳落在 B 区。

## 画完之后的两条注记

**这张图会移动。** 今天在 C 区的任务，模型变强、或者你把标准写清楚之后，半年后可能就进了 B 区；同一个任务，你做熟了、判断变快，也可能从 B 区挪进 A 区。每隔三四个月重看一次就够了。

**先只挑一件跑起来。** 一次挑三件，通常三件都半途而废。挑“每周都做、检查最快”的那一件，先跑两周，再回头改地图。至于提示词怎么写，那是下一步的事——只有地图画出来，你才知道值得为哪几步认真写它。

## 术语表

- AI 工作地图：把自己一周的办公动作列成清单，再逐条判断该放在哪个位置，而不是凭感觉零散地试用 AI。
- 锯齿状前沿：AI 能力分布不均匀，看起来难度相近的两个任务，可能一个做得很好、另一个频繁出错，而且分界线不容易看出来。
- 可验证性：能不能用不需要完整判断力的标准确认产出对错；可验证的任务才容易被模型练好，也才容易被你安全地交出去。
- 验证税：检查 AI 产出所花的时间；它决定交给 AI 这件事实际是赚还是亏。
- 三区划分：直接交给 AI 产出、AI 起草我把关、自己做而 AI 只做外围准备。
- 自动化偏见：反复成功之后人会不自觉地减少检查，而模型出错率并没有因此下降。

## 来源

1. [Harvard Business School / BCG: Navigating the Jagged Technological Frontier — 758 名顾问的对照实验，边界内任务提速 25.1%、质量提升 40% 以上，边界外任务正确率低 19 个百分点](https://www.hbs.edu/faculty/Pages/item.aspx?num=68729)
2. [Andrej Karpathy: Verifiability — 传统软件自动化“可明确规定的”，LLM 自动化“可验证的”](https://karpathy.bearblog.dev/verifiability/)
3. [The Verification Ceiling — 验证成本的构成，以及反复成功导致检查变浅的自动化偏见](https://nakashon.com/frameworks/verification-ceiling/)
4. [Anthropic: Best practices for getting started with Claude Cowork — 判断一项任务是否值得交出去的几条实操判据](https://claude.com/blog/best-practices-for-getting-started-with-claude-cowork)

---

原文：https://pangzhengboyin.com/articles/which-office-tasks-to-delegate-to-ai-6af8f776

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
