# 新版托福口语和写作是谁在打分：AI 评分器看得见什么，看不见什么

从哪些题交给算法、SpeechRater 与 e-rater 靠什么算分，到它们看不见切题与展开，以及没人批改时怎么用转写加两张清单自己搭出反馈闭环

> 托福口语 · 托福写作 · 托福 iBT 2026 改版 · 约 6 分钟 · 10 月 10 日

## 本篇要点

1. 2026 版托福里，口语的 Take an Interview（4 题）和写作的 Write an Email、Academic Discussion 属于 AI 评分；Listen and Repeat（7 题）和 Build a Sentence（10 题）则按预设逻辑机器判分。
2. ETS 官方说口语写作由“AI 评分与认证评分员结合”评出，但公开文档显示人工主要用于质检、模型校验和抽样，具体覆盖范围未公开，算法是第一步评分者。
3. 自动评分器不是理解你的意思，而是预测人工评分员会给的分：它把你的作答和大量高分样本做统计比对，抽取发音、流利度、语法、词汇、结构、长度这类可计算特征。
4. 它能可靠看见形式和语音层面，却看不见你是否真的答到了题目问的那一点、例子是否真的支撑观点；ETS 自己承认 SpeechRater 对 Topic Development 能力有限，e-rater 判断不了内容是否正确。
5. 反馈缺口因此不均匀：有标准答案的题自己就能判、缺口为零；形式层你和引擎都能查；“是否切题、展开是否充分”这一层只有你自己能判，而它恰恰写在评分维度里。
6. 没人批改时的可行做法是四步闭环：录音／成文 → 转写 → 分 A 层（可量化）与 B 层（只有你能判）两张清单 → 一次只改一条 → 重做同一题对照两版。
7. 官方免费练习测试给的最接近官方口径；第三方 AI 评分只当练习估计值，因为练习测试只由电脑评分，e-rater 的分本质上只是预测，不是真考成绩。

---

前面几篇把四科的结构、配速和笔记都过了一遍。但自学者很快会撞上一个更实际的问题：阅读和听力我能自己对答案，口语和写作没人听、没人改，我凭什么知道自己练得对不对？

答案取决于打分的那双眼睛——在新版托福里，它主要不是人的眼睛。

## 一、这两科的分，第一步由算法生成

ETS 公布的 2026 版考试说明，把题型分成两类：一类是 machine scored，用规则算法按预设答案或预设评分逻辑判分；另一类是 AI scored，针对口语和写作这种需要自己组织的作答，用自然语言处理和机器学习去抽取流利度、连贯性、语法这类特征 [1]。

落到两科上，分工写得很清楚 [1]：

- 口语 11 题：Listen and Repeat 7 题是机器判分；Take an Interview 4 题是 AI 评分。
- 写作 12 题：Build a Sentence 10 题是机器判分（每题 1 分）；Write an Email 和 Academic Discussion 各 1 题是 AI 评分（每题 5 分）。

ETS 官网的说法是，口语和写作的作答由“AI 评分与 ETS 认证评分员结合”评出 [2]。但公开的技术文档显示，人工评分主要用在质量检查、评分模型的校验和抽样上；IELTS 一份对比报告读 ETS 技术手册后的说法是，人工到底覆盖多少作答并未完全公开 [3]。所以能确定的是：这几道题的分，是算法先算出来的。口语那套引擎叫 SpeechRater，写作那套叫 e-rater [4][5]。

## 二、它怎么看你：不是读懂你的意思，而是预测人会给几分

机制的关键藏在 ETS 的一句话里：写作的 e-rater，被描述成“预测人工评分员会给这道作答打多少分” [5]。

它的做法，是先把你的作答拆成可计算的特征——写作看语法、用法、拼写、语体、组织、展开；口语则同时用录音和由录音转出的文字，看发音、流利度、词汇和语法——再拿这些特征和大量人工打过高分的样本做比对，算出一个分 [4][5]。它不是在判断你的观点是否成立，而是在判断你的作答“长得像不像高分作答”。（ETS 这些说明写于旧版题型时期，但讲的是同一套引擎。）

**看得见的**：发音的可懂度、语速和停顿这类流利度特征、语法准确度、词汇是否反复、句子之间是否连贯、结构是否完整、长度够不够。ETS 自己的练习区反馈的就是这一层：口语给语速、节奏、发音、语法，写作给语法、用法、拼写、结构 [6]。

**看不见或看不准的**：你这段回答有没有真的回答题目问的那个问题，你举的例子是不是真的支撑了观点。ETS 自己承认，SpeechRater 目前对 Topic Development（内容的切题与展开）这一项能力有限；e-rater 也不能像人一样判断作答里的内容站不站得住 [4][5]。第三方分析还发现，Write an Email 那题所谓的“内容相关”，在特征层面被拆成了句子数量、基础衔接、以及和题目用词的重复度这类表层指标 [3]——也就是说，把句子写长、多插几个连接词，可以让表层指标变好看，却未必等于你把这件事说清楚了。

## 三、这意味着：反馈缺口是不均匀的

把两科的题目按“能不能拿到可靠反馈”排一排，会得到三种不同的处境。

**第一种，有标准答案的题，缺口是零。** Listen and Repeat 的 7 题、Build a Sentence 的 10 题，都按预设逻辑判分 [1]，你自己就能判。复述对不上原句的，漏掉的往往就是词尾、单复数、冠词、语序这些细节；句子拼错的，也一定找得到具体位置。这部分反馈是免费的，却常常被直接浪费掉——很多人练完就往下走，从不回头对照。

**第二种，形式这一层，你和引擎都看得清。** 语法错误、卡壳的长停顿、反复用的那几个词、结构有没有立场—理由—例子—收尾，这些都能逐条数出来。

**第三种，意思这一层，只有你自己能判。** 量表偏偏把“是否切题、展开是否充分”写成了评分维度，而这一项恰好是引擎最弱、最不透明的地方 [3][4]。没人批改时，这一层最容易变成无人区。

## 四、没人批改，就自己搭一个反馈闭环

把上面三种处境合起来，一个自学者能自己跑的闭环是四步。

**第一步，先转写。** 口语录下来，用任意一个听写／转写功能把它变成文字（写作本来就有原文）。把声音变成文字，你才能像改作文一样逐句看它。没有转写，口语的反馈只能停在“感觉还行”。

**第二步，两张清单分开查。**
- A 层（引擎能看、你能量化）：数长停顿和卡壳的位置；回放一遍，看听的人能不能一次听懂；圈出语法错误；圈出反复出现的词；核对有没有立场、理由、例子、收尾；量一下长度够不够。
- B 层（只有你能判）：用一句话重述题目到底在问什么，再看你的回答有没有正面回答它；检查例子具体到什么程度、是不是真的支持你的观点、有没有跑题。

**第三步，一次只改一条。** 从两张清单里挑最具体、最可执行的那一条，别的先放着。

**第四步，重做同一道题，两版并排看。** 有变化，说明这条改到了；没变化，说明它还不是问题的根子。做完这一轮，再刷下一套题。这样一轮的收益，通常比多做一套模拟大。

至于工具怎么摆：

- **官方渠道优先。** ETS 的免费全套练习测试和分项练习，给的正是上面这套反馈，还会附上转写和示范回答 [6]。这是你能拿到的最接近官方口径的参照。
- **第三方 AI 评分器只当练习估计值，别当预测分。** ETS 自己讲得很清楚：练习测试只由电脑评分，和真考“人加机”并不完全一样，而 e-rater 的分本质上只是“预测” [5]。
- **让它逐条对照量表给具体修改点，比让它给一个总分有用。** 固定同一套提示词、同一张清单，你才能把两次练习的变化对照起来。

一句话收束：没人批改时，你能拿到的最有用的反馈，其实一半来自你自己的录音。引擎负责你能自查的那一层，切题和展开这两件最要紧的事，只能你自己盯着。

## 术语表

- AI 评分（AI scored）：针对口语、写作这类需要自己组织的作答，用自然语言处理和机器学习抽取特征来打分；与按预设答案或预设逻辑判分的 machine scored 相对。
- SpeechRater 与 e-rater：ETS 的两套自动评分引擎，前者评口语（同时用录音和转写文字，看发音、流利度、词汇、语法），后者评写作；e-rater 的分数被 ETS 描述成“预测人工评分员会给的分”。
- Topic Development：人类评分维度里讲“内容是否切题、展开是否充分”的那一项，也是自动评分器目前最薄弱、最不透明的一项。
- 转写：把口语录音变成文字，是自学者能把口语像作文一样逐句检查的前提。
- 自评闭环：转写 → A 层（形式，可量化）与 B 层（意思，只能自己判）两张清单 → 一次只改一条 → 重做同一道题对照两版。

## 来源

1. [ETS《TOEFL iBT Test: 2026 Update》考试说明 — 机器判分与 AI 评分的区分、各题型题量与每题分值](https://www.ets.org/pdfs/toefl/toefl-ibt-test-specifications-2026.pdf)
2. [ETS 官方：Test Content and Structure of the TOEFL iBT Test — 口语写作由「AI 评分与 ETS 认证评分员结合」评出](https://www.ets.org/toefl/china/toefl/content-structure.html)
3. [IELTS 研究报告：Comparing New TOEFL 2026 with Former TOEFL 2023 and IELTS — 人工评分角色未完全公开、Email 题内容相关性依赖表层指标、面试题切题与展开在引擎特征中无明确对应](https://ielts.org/cdn/ielts-research-reports/comparing-new-toefl-2026-with-former-toefl-2023-and-ielts-ren-et-al-2026.pdf)
4. [ETS：SpeechRater Service — 口语自动评分服务评的发音、流利度、词汇、语法，及对 Topic Development 的局限](https://www.ets.org/speechrater.html)
5. [ETS：Frequently Asked Questions about TOEFL Practice Online — e-rater 与 SpeechRater 的机制、e-rater 是对人工评分的「预测」、练习测试仅由电脑评分及其局限](https://www.ets.org/s/toefl/pdf/toefl_tpo_faq.pdf)
6. [ETS：TOEFL TestReady 备考产品说明 — 免费全套练习测试的四科自动评分，口语写作反馈内容与示范回答](https://www.eu.ets.org/toefl/test-takers/ibt/prepare/toefl-testready.html)

---

原文：https://pangzhengboyin.com/articles/toefl-ai-scoring-what-it-sees-d75d9ac6

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
