前面几篇把四科的结构、配速和笔记都过了一遍。但自学者很快会撞上一个更实际的问题:阅读和听力我能自己对答案,口语和写作没人听、没人改,我凭什么知道自己练得对不对?

答案取决于打分的那双眼睛——在新版托福里,它主要不是人的眼睛。

一、这两科的分,第一步由算法生成

ETS 公布的 2026 版考试说明,把题型分成两类:一类是 machine scored,用规则算法按预设答案或预设评分逻辑判分;另一类是 AI scored,针对口语和写作这种需要自己组织的作答,用自然语言处理和机器学习去抽取流利度、连贯性、语法这类特征 1。

落到两科上,分工写得很清楚 1:

  • 口语 11 题:Listen and Repeat 7 题是机器判分;Take an Interview 4 题是 AI 评分。
  • 写作 12 题:Build a Sentence 10 题是机器判分(每题 1 分);Write an Email 和 Academic Discussion 各 1 题是 AI 评分(每题 5 分)。

ETS 官网的说法是,口语和写作的作答由“AI 评分与 ETS 认证评分员结合”评出 2。但公开的技术文档显示,人工评分主要用在质量检查、评分模型的校验和抽样上;IELTS 一份对比报告读 ETS 技术手册后的说法是,人工到底覆盖多少作答并未完全公开 3。所以能确定的是:这几道题的分,是算法先算出来的。口语那套引擎叫 SpeechRater,写作那套叫 e-rater 45。

二、它怎么看你:不是读懂你的意思,而是预测人会给几分

机制的关键藏在 ETS 的一句话里:写作的 e-rater,被描述成“预测人工评分员会给这道作答打多少分” 5。

它的做法,是先把你的作答拆成可计算的特征——写作看语法、用法、拼写、语体、组织、展开;口语则同时用录音和由录音转出的文字,看发音、流利度、词汇和语法——再拿这些特征和大量人工打过高分的样本做比对,算出一个分 45。它不是在判断你的观点是否成立,而是在判断你的作答“长得像不像高分作答”。(ETS 这些说明写于旧版题型时期,但讲的是同一套引擎。)

看得见的:发音的可懂度、语速和停顿这类流利度特征、语法准确度、词汇是否反复、句子之间是否连贯、结构是否完整、长度够不够。ETS 自己的练习区反馈的就是这一层:口语给语速、节奏、发音、语法,写作给语法、用法、拼写、结构 6。

看不见或看不准的:你这段回答有没有真的回答题目问的那个问题,你举的例子是不是真的支撑了观点。ETS 自己承认,SpeechRater 目前对 Topic Development(内容的切题与展开)这一项能力有限;e-rater 也不能像人一样判断作答里的内容站不站得住 45。第三方分析还发现,Write an Email 那题所谓的“内容相关”,在特征层面被拆成了句子数量、基础衔接、以及和题目用词的重复度这类表层指标 3——也就是说,把句子写长、多插几个连接词,可以让表层指标变好看,却未必等于你把这件事说清楚了。

三、这意味着:反馈缺口是不均匀的

把两科的题目按“能不能拿到可靠反馈”排一排,会得到三种不同的处境。

第一种,有标准答案的题,缺口是零。 Listen and Repeat 的 7 题、Build a Sentence 的 10 题,都按预设逻辑判分 1,你自己就能判。复述对不上原句的,漏掉的往往就是词尾、单复数、冠词、语序这些细节;句子拼错的,也一定找得到具体位置。这部分反馈是免费的,却常常被直接浪费掉——很多人练完就往下走,从不回头对照。

第二种,形式这一层,你和引擎都看得清。 语法错误、卡壳的长停顿、反复用的那几个词、结构有没有立场—理由—例子—收尾,这些都能逐条数出来。

第三种,意思这一层,只有你自己能判。 量表偏偏把“是否切题、展开是否充分”写成了评分维度,而这一项恰好是引擎最弱、最不透明的地方 34。没人批改时,这一层最容易变成无人区。

四、没人批改,就自己搭一个反馈闭环

把上面三种处境合起来,一个自学者能自己跑的闭环是四步。

第一步,先转写。 口语录下来,用任意一个听写/转写功能把它变成文字(写作本来就有原文)。把声音变成文字,你才能像改作文一样逐句看它。没有转写,口语的反馈只能停在“感觉还行”。

第二步,两张清单分开查。

  • A 层(引擎能看、你能量化):数长停顿和卡壳的位置;回放一遍,看听的人能不能一次听懂;圈出语法错误;圈出反复出现的词;核对有没有立场、理由、例子、收尾;量一下长度够不够。
  • B 层(只有你能判):用一句话重述题目到底在问什么,再看你的回答有没有正面回答它;检查例子具体到什么程度、是不是真的支持你的观点、有没有跑题。

第三步,一次只改一条。 从两张清单里挑最具体、最可执行的那一条,别的先放着。

第四步,重做同一道题,两版并排看。 有变化,说明这条改到了;没变化,说明它还不是问题的根子。做完这一轮,再刷下一套题。这样一轮的收益,通常比多做一套模拟大。

至于工具怎么摆:

  • 官方渠道优先。 ETS 的免费全套练习测试和分项练习,给的正是上面这套反馈,还会附上转写和示范回答 6。这是你能拿到的最接近官方口径的参照。
  • 第三方 AI 评分器只当练习估计值,别当预测分。 ETS 自己讲得很清楚:练习测试只由电脑评分,和真考“人加机”并不完全一样,而 e-rater 的分本质上只是“预测” 5。
  • 让它逐条对照量表给具体修改点,比让它给一个总分有用。 固定同一套提示词、同一张清单,你才能把两次练习的变化对照起来。

一句话收束:没人批改时,你能拿到的最有用的反馈,其实一半来自你自己的录音。引擎负责你能自查的那一层,切题和展开这两件最要紧的事,只能你自己盯着。