上一篇把 710 分拆到了每个题型,结论是先保仔细阅读和听力篇章。真开始做题就会撞上下一道坎:分值是算明白了,可文章读不懂、句子听不清,卡住的往往不是技巧,是词。这篇算的就是词汇这笔账——不是“背多少词”,而是同样花 100 小时,把词选对和选错,差距有多大。

4500、4795,这些数字本身说明不了什么

四级词汇量最常见的两个说法是“4500 词”和“约 4795 个单词加 700 个词组”。后者出自 2007 年教育部《大学英语课程教学要求》的“一般要求”,四级对应的就是这一档;同一份文件里“较高要求”(大致对应六级)是约 6395 个单词加 1200 个词组。两个数字口径不同,年份不同,辅导资料转述时又常取整成 4500。纠结这个差别没有意义,因为它不影响你做任何决定。

真正有用的是同一句话的后半段:这 4795 个词里,约 2000 个要求“复用式掌握”,也就是能在口头和书面表达中熟练运用,其余只要求“领会式掌握”,即见到、听到能懂。官方文件自己就把词汇分成了两档,这一点后面会反复用到。

另一个被普遍忽略的事实是:这些数字 包含中学已学部分。高中课标要求的三千多词本来就在里面,四级真正新增的只有一千多个。所以“我要背 4500 个单词”这句话从起点就错了——其中大部分是复习,不是新学。你要补的是中间那一层:认识但不熟、见过但想不起意思的中频词。

字母序为什么是最贵的一种顺序

先把“顺序成本”这个概念说清楚。假设你总共只背得起 2000 个词,那么你的成绩不取决于你背了多少个,而取决于 你背的这 2000 个正好是哪些。词表选得不同,同样努力换来的覆盖率差出一大截。这就是顺序成本。

词频分布遵守齐夫定律:把词按出现频率从高到低排名,第 rr 名的词在语料中出现的频率大致与 1/r1/r 成正比,即 fr1/rf_r \propto 1/r。拿这个模型粗估四级 4500 词的覆盖情况(指数取 1,真实语料里指数略大于 1,实际会更集中):

按频率序背到占词表比例覆盖文本中的词次
前 900 词20%约 82%
前 2000 词44%约 91%
剩下的 2500 词56%不到 10%

也就是说,后半张词表加起来只承担不到一成的阅读量。二语词汇研究里对英文语料的统计(Paul Nation 等人的覆盖率研究)给出的是同一量级:最高频的 2000 个词族大致覆盖日常书面文本的八成上下,具体数值随语料类型浮动。量级是一致的——高频区和长尾区的回报差了几十倍,而不是几倍。

再看字母序。单词书按 A 到 Z 排版,和词频几乎无关:字母排在前半的词,并不比后半的词更常用。所以按字母序背,你付出的努力和拿到的覆盖率大致是线性对应的关系——背到字母表一半,覆盖的文本词次也就在一半上下,具体差多少取决于这本书怎么排。同样是背 2000 多词,频率序能覆盖九成,字母序只能覆盖一半。这中间约 40 个百分点的差距,就是你多花的时间。

从词表开头那一批词上,能直观看到这件事。abandon、abstract、absurd、abundant、accelerate 这类词,在几套四级真题里出现的次数常常是个位数,有的压根不出现;而 however、research、increase、difficult 这类词,一套题里就要碰到几十次。更微妙的是,高频层里相当一部分是你高中就会的词,所以四级词汇的真实任务其实是“补中频层”——而中频词在一本按字母排的书里是随机散落的,只有频率序能把它们拎出来排好。

还有一个不那么理性但更致命的原因:从 A 背到 Z 意味着你前面几个月全在低回报区,读完一篇文章一个用上的词都没有,反馈为零。绝大多数人放弃不是因为毅力差,是因为前 20 小时没有任何可感知的回报。

你的词表就是那几套真题

顺着上面的逻辑,最合适的词表不是任何一本现成的书,是你打算做的真题。具体做法分四步。

圈词。 拿最近年份的 5 到 10 套真题(5 套是下限,套数太少会有抽样偏差)。做题时只做一件事:不认识的词先圈上,别停下来查,先按正常节奏做完。做完之后再统一查。停下来查词会同时毁掉阅读的限时训练效果。

登记并排序。 把圈出的词记进一张表格,写下词、出现在哪个题型、在多少套题里出现过。用表格的查找重复或数据透视功能排一次出现次数,按降序排。这里有一个必须做的动作:合并词族。confirm、confirmation、confirmed 算一个词,词频统计工具就是这么算的。不合并的话,靠派生词凑出来的次数会虚高,优先级会被排序错误。

做完这一步你会得到一个具体数字:真正不在高中词汇里的词,通常只有几百到一千多个;出现三次以上的更少。这个数字不要信任何人给你的结论,五套真题加半小时表格就能自己算出来,它比任何“四级核心词汇 1000 个”的书都准。

分两档投入。 这是全篇最省时间的一步。阅读和听力只要求被动认识:见到、听到能反应出意思,不要求会拼会写。写作和翻译要求主动会用:能默出拼写,能用对搭配。

判断一个词该进哪一档,标准不是“这个词重不重要”,而是“它会不会出现在我要写的东西里”。写作考的是话题议论和书信,翻译考的是中文段落翻英文,话题集中在传统文化、社会发展和日常生活这类范围。所以主动档的规模比你想的小得多:一批通用表达加上一批话题词,其余全部按被动档处理。把被动档的词也要求拼写,等于把工作量翻倍,换回来的是零分收益。

题型专属的部分单独处理。 选词填空是唯一需要判断词性的题型,因为填进去要语法通,所以圈词时顺手记词性——但别忘了上一篇算过的账,它只有 35.5 分,不值得为它单独建一套词表。短篇新闻有自己的场景词,同一类新闻里反复出现,遇到时单独标一下即可。

正在绘制图表

怎么知道是真背住了,还是眼熟

自测方式决定了你会不会骗自己。用单词书自测有两个结构性问题:它给你四个中文选项,识别变成了排除法;它也不提供句子,而考试里你是在句子中间认词的,这是两个不同的任务。

可靠的回测要满足三条。

材料必须是从没做过的真题,不是你背词时用过的那几套。时间上至少隔三天,理想状态是再隔一周补一次。判定只有“过”和“不过”两个结果,没有“好像见过”——被动档的标准是读句子时不停顿、不查词就反应出意思,能打断阅读节奏就算不过;主动档的标准是在空白纸上默写出拼写和搭配正确的完整表达,比如不是“会拼 decision”,而是能写出 make a decision。过不了的词退回待办池,过掉的划掉。池子会肉眼可见地变小,这个反馈本身就是坚持下去的理由。

这套账在哪里会失效

真题词表法保的是 425 到 500 这个区间。如果你要冲 550 以上,或者打算接着考六级,就必须回头补低频词——六级词汇量的口径已经在 5500 到 6000 词这一段。真题里的高频词覆盖的是必考部分,不覆盖拉高分的部分。

另外两条边界:五套真题能看到的词,必然漏掉只在前几年出现过的词,条件允许就用十套;圈词时对“认不认识”的自我判断会偏松,很多人把“见过但想不起意思”算成了认识,而这恰恰是最该进表的一类词。

和上一篇一样,这里的排序逻辑只有一条:按回报排,不按陌生度排。下一篇该算的,是这些词落到具体题型上之后,哪种题该用什么手法——那笔账的入口,正好是写作和翻译这两个“需要主动会用”的模块。