# 四级词汇账：为什么字母序是最贵的背法，真题才是你的词表

用词频和题型需求给单词排序，把有限的时间花在覆盖八成文本的那一小块词上

> 词汇策略 · 真题训练 · 词频 · 约 8 分钟 · 09 月 16 日

## 本篇要点

1. 四级词汇量常被引用的口径是 4500 词或“约 4795 词 + 700 词组”，这个数字包含中学已学部分，真正新增的中频词只有一千多个，两个口径的差异不影响任何复习决定。
2. 官方课程文件本身就把词汇分成“领会式掌握”和“复用式（积极）掌握”两档，约 2000 词要求能熟练运用，其余只需见到听到能懂——这个分层是分档投入的官方依据。
3. 词频遵守齐夫定律 $f_r \propto 1/r$，按此粗估四级词表中前 20% 的词覆盖约 82% 的文本词次，后 56% 的词合计覆盖不到 10%，高频区与长尾区的回报差几十倍。
4. “顺序成本”指的是同样的背诵量，选词不同导致覆盖率差出约 40 个百分点：字母序和词频几乎无关，背到字母表一半大致只覆盖一半，频率序背 2000 多词可覆盖九成。
5. 可执行的做法是把最近 5 至 10 套真题当词表：做题时只圈不认识的词、事后统一查、登记出现次数、合并词族（confirm/confirmation 算一个）、按次数降序排优先级。
6. 分档标准是“这个词会不会出现在我要写的东西里”而非“重不重要”：阅读听力只需被动认识，写作翻译才需主动拼写和搭配，主动档范围远小于高频词表。
7. 回测必须用没做过的新真题、隔三天和一周各做一次、只判过或不过：被动档以不打断阅读节奏为准，主动档以默写出搭配正确的完整表达为准；单词书自测因给选项、无语境而不可靠。
8. 真题词表法保的是 425 至 500 区间；冲 550 以上或备考六级需补 5500 至 6000 词段的低频词，且 5 套真题是抽样下限。

---

上一篇把 710 分拆到了每个题型，结论是先保仔细阅读和听力篇章。真开始做题就会撞上下一道坎：分值是算明白了，可文章读不懂、句子听不清，卡住的往往不是技巧，是词。这篇算的就是词汇这笔账——不是“背多少词”，而是同样花 100 小时，把词选对和选错，差距有多大。

## 4500、4795，这些数字本身说明不了什么

四级词汇量最常见的两个说法是“4500 词”和“约 4795 个单词加 700 个词组”。后者出自 2007 年教育部《大学英语课程教学要求》的“一般要求”，四级对应的就是这一档；同一份文件里“较高要求”（大致对应六级）是约 6395 个单词加 1200 个词组。两个数字口径不同，年份不同，辅导资料转述时又常取整成 4500。纠结这个差别没有意义，因为它不影响你做任何决定。

真正有用的是同一句话的后半段：这 4795 个词里，约 2000 个要求“复用式掌握”，也就是能在口头和书面表达中熟练运用，其余只要求“领会式掌握”，即见到、听到能懂。官方文件自己就把词汇分成了两档，这一点后面会反复用到。

另一个被普遍忽略的事实是：这些数字**包含中学已学部分**。高中课标要求的三千多词本来就在里面，四级真正新增的只有一千多个。所以“我要背 4500 个单词”这句话从起点就错了——其中大部分是复习，不是新学。你要补的是中间那一层：认识但不熟、见过但想不起意思的中频词。

## 字母序为什么是最贵的一种顺序

先把“顺序成本”这个概念说清楚。假设你总共只背得起 2000 个词，那么你的成绩不取决于你背了多少个，而取决于**你背的这 2000 个正好是哪些**。词表选得不同，同样努力换来的覆盖率差出一大截。这就是顺序成本。

词频分布遵守齐夫定律：把词按出现频率从高到低排名，第 $r$ 名的词在语料中出现的频率大致与 $1/r$ 成正比，即 $f_r \propto 1/r$。拿这个模型粗估四级 4500 词的覆盖情况（指数取 1，真实语料里指数略大于 1，实际会更集中）：

| 按频率序背到 | 占词表比例 | 覆盖文本中的词次 |
| --- | --- | --- |
| 前 900 词 | 20% | 约 82% |
| 前 2000 词 | 44% | 约 91% |
| 剩下的 2500 词 | 56% | 不到 10% |

也就是说，后半张词表加起来只承担不到一成的阅读量。二语词汇研究里对英文语料的统计（Paul Nation 等人的覆盖率研究）给出的是同一量级：最高频的 2000 个词族大致覆盖日常书面文本的八成上下，具体数值随语料类型浮动。量级是一致的——**高频区和长尾区的回报差了几十倍，而不是几倍。**

再看字母序。单词书按 A 到 Z 排版，和词频几乎无关：字母排在前半的词，并不比后半的词更常用。所以按字母序背，你付出的努力和拿到的覆盖率大致是线性对应的关系——背到字母表一半，覆盖的文本词次也就在一半上下，具体差多少取决于这本书怎么排。同样是背 2000 多词，频率序能覆盖九成，字母序只能覆盖一半。这中间约 40 个百分点的差距，就是你多花的时间。

从词表开头那一批词上，能直观看到这件事。abandon、abstract、absurd、abundant、accelerate 这类词，在几套四级真题里出现的次数常常是个位数，有的压根不出现；而 however、research、increase、difficult 这类词，一套题里就要碰到几十次。更微妙的是，高频层里相当一部分是你高中就会的词，所以四级词汇的真实任务其实是“补中频层”——而中频词在一本按字母排的书里是随机散落的，只有频率序能把它们拎出来排好。

还有一个不那么理性但更致命的原因：从 A 背到 Z 意味着你前面几个月全在低回报区，读完一篇文章一个用上的词都没有，反馈为零。绝大多数人放弃不是因为毅力差，是因为前 20 小时没有任何可感知的回报。

## 你的词表就是那几套真题

顺着上面的逻辑，最合适的词表不是任何一本现成的书，是你打算做的真题。具体做法分四步。

**圈词。** 拿最近年份的 5 到 10 套真题（5 套是下限，套数太少会有抽样偏差）。做题时只做一件事：不认识的词先圈上，别停下来查，先按正常节奏做完。做完之后再统一查。停下来查词会同时毁掉阅读的限时训练效果。

**登记并排序。** 把圈出的词记进一张表格，写下词、出现在哪个题型、在多少套题里出现过。用表格的查找重复或数据透视功能排一次出现次数，按降序排。这里有一个必须做的动作：**合并词族**。confirm、confirmation、confirmed 算一个词，词频统计工具就是这么算的。不合并的话，靠派生词凑出来的次数会虚高，优先级会被排序错误。

做完这一步你会得到一个具体数字：真正不在高中词汇里的词，通常只有几百到一千多个；出现三次以上的更少。这个数字不要信任何人给你的结论，五套真题加半小时表格就能自己算出来，它比任何“四级核心词汇 1000 个”的书都准。

**分两档投入。** 这是全篇最省时间的一步。阅读和听力只要求被动认识：见到、听到能反应出意思，不要求会拼会写。写作和翻译要求主动会用：能默出拼写，能用对搭配。

判断一个词该进哪一档，标准不是“这个词重不重要”，而是“它会不会出现在我要写的东西里”。写作考的是话题议论和书信，翻译考的是中文段落翻英文，话题集中在传统文化、社会发展和日常生活这类范围。所以主动档的规模比你想的小得多：一批通用表达加上一批话题词，其余全部按被动档处理。把被动档的词也要求拼写，等于把工作量翻倍，换回来的是零分收益。

**题型专属的部分单独处理。** 选词填空是唯一需要判断词性的题型，因为填进去要语法通，所以圈词时顺手记词性——但别忘了上一篇算过的账，它只有 35.5 分，不值得为它单独建一套词表。短篇新闻有自己的场景词，同一类新闻里反复出现，遇到时单独标一下即可。

```mermaid
flowchart LR
  A["5–10 套真题<br/>只圈不认识的词"] --> B["登记 + 合并词族<br/>按出现次数降序"]
  B --> C{"这个词<br/>会出现在我要写的东西里吗？"}
  C -- "会（写作/翻译）" --> D["主动档：<br/>会拼写、会搭配"]
  C -- "不会（阅读/听力）" --> E["被动档：<br/>见到听到秒认意思"]
  D --> F["回测：换新真题，<br/>只判过或不过"]
  E --> F
```

## 怎么知道是真背住了，还是眼熟

自测方式决定了你会不会骗自己。用单词书自测有两个结构性问题：它给你四个中文选项，识别变成了排除法；它也不提供句子，而考试里你是在句子中间认词的，这是两个不同的任务。

可靠的回测要满足三条。

材料必须是从没做过的真题，不是你背词时用过的那几套。时间上至少隔三天，理想状态是再隔一周补一次。判定只有“过”和“不过”两个结果，没有“好像见过”——被动档的标准是读句子时不停顿、不查词就反应出意思，能打断阅读节奏就算不过；主动档的标准是在空白纸上默写出拼写和搭配正确的完整表达，比如不是“会拼 decision”，而是能写出 make a decision。过不了的词退回待办池，过掉的划掉。池子会肉眼可见地变小，这个反馈本身就是坚持下去的理由。

## 这套账在哪里会失效

真题词表法保的是 425 到 500 这个区间。如果你要冲 550 以上，或者打算接着考六级，就必须回头补低频词——六级词汇量的口径已经在 5500 到 6000 词这一段。真题里的高频词覆盖的是必考部分，不覆盖拉高分的部分。

另外两条边界：五套真题能看到的词，必然漏掉只在前几年出现过的词，条件允许就用十套；圈词时对“认不认识”的自我判断会偏松，很多人把“见过但想不起意思”算成了认识，而这恰恰是最该进表的一类词。

和上一篇一样，这里的排序逻辑只有一条：按回报排，不按陌生度排。下一篇该算的，是这些词落到具体题型上之后，哪种题该用什么手法——那笔账的入口，正好是写作和翻译这两个“需要主动会用”的模块。

## 来源

1. [教育部《大学英语课程教学要求》（2007）——四级对应“一般要求”：约 4795 个单词和 700 个词组，其中约 2000 个为复用式掌握](https://www.moe.gov.cn/srcsite/A08/s7056/200709/t20070926_110779.html)
2. [Paul Nation, Teaching and Learning Vocabulary（1990）——英语最高频词族对书面文本的覆盖率研究](https://www.wgtn.ac.nz/lals/resources/paul-nations-resources/paul-nations-publications/publications/documents/1990-nation-teaching-vocab.pdf)
3. [Zipf's law——词频与排名成反比 $f_r \propto 1/r$ 的说明与语料统计背景](https://en.wikipedia.org/wiki/Zipf%27s_law)

---

原文：https://pangzhengboyin.com/articles/cet4-vocabulary-frequency-order-21b1bdf6

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
