# 样本量再大也修不好的那种错：偏差和随机波动，到底差在哪

波动方向随机、多抽几批会互相抵消，加样本就能压住；偏差方向固定，来自“谁被算进了数据”，样本量再大也不减小，只会让你更确定地报出一个错数

> 抽样误差 · 结论表达 · 数据分析流程 · 约 6 分钟 · 10 月 10 日

## 本篇要点

1. 从样本算出的数可以拆成三块：真值、偏差、波动。
2. 波动来自偶然，方向随机、可正可负，多抽几批会互相抵消，尺度约按 $1/\sqrt{n}$ 缩小；偏差来自抽样和收集方式，方向固定，多抽几批不会抵消。
3. 样本量扩大的是精确度而不是准确度：大样本让波动范围变窄，偏差却保持原样，结果是更确定地远离真相。
4. 《文学文摘》1936 年收回 240 万份问卷仍预测错大选，而盖洛普约 5 万人的样本预测到 1 个百分点内；1928 和 1936 两次调查的误差都偏向同一个方向，这是偏差而非运气的签名。
5. 偏差的三条常见来源都指向“谁被算进了数据”：名单缺人（覆盖不全）、被抽到的人不回答（无应答、自我选择）、数据只来自活下来的样本（存活偏差，如飞机弹孔）。
6. 无害的缺失是随机的，会归进波动；有方向的缺失才变成偏差。
7. 判断方法：换渠道或换名单再算一次，中心整体平移就是偏差；误差反复站同一边也是偏差；区间窄不代表对，波动范围管不住偏差。
8. 事后加权能减轻一部分偏差，但只能按已测量且已知真实比例的变量做；更根本的办法是改数据的收集方式，或在结论里说明排除了谁。

---

上一篇讲到“数据本身的毛病”也是关联不等于因果的一条路。这一篇把那条路单独走一遍：同样是数不准，有的不准能靠多收数据压下去，有的收再多也没用——而且数据越多，错得越让人放心。

## 一个“样本越大、错得越准”的案例

1936 年美国总统大选前，美国《文学文摘》（Literary Digest）杂志做了一次史上规模的民调：寄出约一千万张明信片，收回约 240 万份，预测共和党人兰登会拿到 54% 的普选票、370 张选举人票，大胜在任总统罗斯福。结果兰登只拿到约 40% 的普选票和 8 张选举人票，罗斯福赢了 48 个州中的 46 个 [1][2]。同年，盖洛普用大约 5 万人的样本，把结果预测到了实际得票的 1 个百分点以内 [4]。

240 万比 5 万，样本量大近 50 倍，却输得干净。而且这不是运气：1928 和 1936 两次调查，每个州都把共和党候选人的得票率高估了 [2]。错得这么稳定，说明问题不在“抽得少”，而在“抽得歪”。

## 误差其实分两笔账，只有一笔能还清

任何一个从样本算出来的数，都可以拆成三块：

$$\text{估计值} \;=\; \text{真值} \;+\; \text{偏差} \;+\; \text{波动}$$

**波动**是上一篇讲过的“晃动”：同一套流程重来一遍，谁被抽到、谁点了按钮，都是偶然的，这次高一点、下次低一点。它的尺度大致按 $1/\sqrt{n}$ 缩小——样本量翻四倍，晃动减半 [1]。关键在它**对称**：多抽几批，高的和低的会互相抵消，平均起来中心落回真值附近。所以波动是能靠样本量还清的账。

**偏差**不是“这次高了、下次低了”，而是**永远朝同一个方向偏**。它的来源是选样本、收样本的方式：人群里有一部分人比别人更占“被算进数据”的优势，于是数据里的构成和真实人群不一样。方向固定，多抽几批不会互相抵消，平均完还是偏。

两笔账放一起看就清楚了。假设真实支持率是 40%，但你的名单让某一类人多进来一些，造成 +10 个百分点的偏差：

| 样本量 | 波动范围（约） | 你会报出的数 | 真实值 |
| --- | --- | --- | --- |
| 1,000 | ±3 个百分点 | 50% | 40% |
| 250,000 | ±0.2 个百分点 | 50.0% | 40% |

样本量涨了 250 倍，波动从 ±3 缩到 ±0.2，看上去精确多了；可中心仍然是 50%，离 40% 还差 10 个百分点。**样本量扩大的是精确度，不是准确度。** 更麻烦的是：样本量越大，你给出的波动范围越窄，越容易理直气壮地宣布一个错得离谱的数字。大样本碰上偏差，得到的不是“更接近真相”，而是“更确定地远离真相”。

## 偏差从哪来：三种“谁被算进了数据”

偏差的根都不在数字本身，而在“这份数据里的每个人，被算进来的机会是不是一样”。

**名单本身就不全。** 抽样是在一份名单上做的，可名单未必覆盖你要研究的人。《文学文摘》的名单主要来自电话簿和汽车登记册；那个年代装得起电话、买得起车的人偏富裕、偏年长、偏共和党 [1][2]。名单外的人不是“抽不到”，而是**根本没机会被抽到**。今天同理：只统计 App 用户，就自动排除了卸载过的人；只统计注册用户，就排除了没注册成功的访客。

**被抽到的人回不回答。** 这是《文学文摘》翻车的另一半原因，可能还是更大的一半。一千万张明信片只收回 240 万份，回信率约四分之一；后来用 1937 年的盖洛普数据反查发现，**没回信的人里支持罗斯福的是绝对多数** [1]。不是名单缺人，而是被邀请的人里，某一类更愿意开口。这叫无应答偏差，也叫自我选择偏差。同一件事天天在身边发生：App 商店评分来自愿意评分的人；满意度问卷发在用完服务那一刻，最不满意的顾客早就退出了。

**你只看得见活下来的。** 二战时统计学家亚伯拉罕·瓦尔德研究给轰炸机加装甲。他手上的数据是飞回来的飞机身上的弹孔——机身弹孔最密，发动机附近反而很少。直觉是加固机身，瓦尔德的判断相反：敌人开火大致均匀撒在飞机上，发动机弹孔在数据里异常地少，说明**发动机中弹的飞机没能飞回来**，所以发动机才是要害 [3]。这个故事的流传版本简化了不少细节，但机制是真的：当数据只来自“活下来的人”，没进来的样本不是随机缺失的，而是**被你要研究的那个结果筛掉的**。你统计留下用户的满意度，走掉的人的意见永远不会出现在表里。

```mermaid
flowchart LR
  T["目标人群"] --> F{"谁能进入数据"}
  F -->|"名单里没有"| M1["覆盖不全"]
  F -->|"被抽到但不回答"| M2["无应答 / 自我选择"]
  F -->|"被结果筛掉了"| M3["存活偏差"]
  M1 --> B["方向固定的偏移"]
  M2 --> B
  M3 --> B
  B --> R["样本量再大也不减小"]
```

三条路的共同点：被漏掉的人并非随机，而是跟你要测的东西有关系。随机缺失（今天谁没接电话纯属偶然）会归到波动里；有方向的缺失才变成偏差。

## 怎么判断错的是哪一笔

**多抽几批，中心会不会动？** 波动让每批结果在中心附近跳，综合起来中心稳定；偏差让中心整体平移。最省事的做法是**换一个渠道再算一次**：同一件事分别在 App 内问卷、邮件、电话里问。渠道一换中心就大幅移动，你面对的是偏差。

**误差是不是总朝一个方向？** 《文学文摘》连续几届都偏向同一个党，这就是偏差的签名 [2]。把数据按时间、地区切开，如果误差反复站同一边，别再指望“样本再多点就准了”。反过来也要记住：波动范围只管住了波动那一笔账，它对偏差一无所知，所以区间窄不等于对。

## 边界：偏差不是没救，但更难还

偏差有办法减小，只是成本更高、把握更小。常见做法是事后按已知的人群构成加权——发现样本里某类人偏多，就给他们调低权重。这不是空想：研究者用《文学文摘》里问到的 1932 年投票回忆重新加权，就能把胜者预测对 [2]。但要注意两点：加权只能按**你已经测量到、并且知道真实比例**的变量做；而且即便加权后预测对了胜者，票差依然偏得很厉害 [2]。

对日常工作的建议就一句：**波动大，去加样本量；怀疑偏差，去改数据是怎么来的**——补上漏掉的人，让沉默的人说话，或者在结论里直说自己排除了谁。

最后别走到另一个极端。样本量依然重要，它压住的波动是实打实会误导决策的。只是《文学文摘》的教训不是“大样本没用”，而是**在你确认数据里的人都该被算进来之前，样本量只放大了你的自信**。

## 术语表

- 随机波动：同一套流程重来一遍会变的那部分误差，方向随机、可正可负，样本量越大越小，靠扩大样本就能还清。
- 偏差：数据永远朝同一个方向偏的那部分误差，来自“谁被算进数据”的机制，方向固定，样本量再大也不减小。
- 抽样框（覆盖范围）：真正有机会被抽到的那份名单；名单漏掉的人等于零概率入选，由此产生的偏差。
- 无应答偏差 / 自我选择偏差：被抽到却不愿回答的人与愿意回答的人本身不同，回信的人因此不能代表全体。
- 存活偏差：数据只来自通过了某个结果筛选的样本（活下来的人、还在用的功能），被筛掉的信息永久缺失，而且缺失不随机。

## 来源

1. [Squire (1988), Why the 1936 Literary Digest Poll Failed — 用 1937 年盖洛普数据说明《文学文摘》的样本偏差与无应答偏差](https://academic.oup.com/poq/article/52/1/125/1878544)
2. [Taking the Next Step in Exploring the Literary Digest 1936 Poll — 复盘 1936 年调查的寄送量、回信量与逐州误差方向，并演示加权为何能救回胜者预测](https://www.tandfonline.com/doi/full/10.1080/26939169.2024.2395505)
3. [AMS Feature Column: The Legend of Abraham Wald — 瓦尔德的飞机弹孔分析与存活偏差机制](https://www.ams.org/publicoutreach/feature-column/fc-2016-06)
4. [Big Data and Large Sample Size: A Cautionary Note on the Potential for Bias — 大样本不能克服系统性偏差，反而可能放大它](https://exa.ai/library/publication/dzqqdkzh1f9)

---

原文：https://pangzhengboyin.com/articles/bias-vs-random-error-sample-size-e42266a3

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
