上一篇讲到“数据本身的毛病”也是关联不等于因果的一条路。这一篇把那条路单独走一遍:同样是数不准,有的不准能靠多收数据压下去,有的收再多也没用——而且数据越多,错得越让人放心。

一个“样本越大、错得越准”的案例

1936 年美国总统大选前,美国《文学文摘》(Literary Digest)杂志做了一次史上规模的民调:寄出约一千万张明信片,收回约 240 万份,预测共和党人兰登会拿到 54% 的普选票、370 张选举人票,大胜在任总统罗斯福。结果兰登只拿到约 40% 的普选票和 8 张选举人票,罗斯福赢了 48 个州中的 46 个 12。同年,盖洛普用大约 5 万人的样本,把结果预测到了实际得票的 1 个百分点以内 4。

240 万比 5 万,样本量大近 50 倍,却输得干净。而且这不是运气:1928 和 1936 两次调查,每个州都把共和党候选人的得票率高估了 2。错得这么稳定,说明问题不在“抽得少”,而在“抽得歪”。

误差其实分两笔账,只有一笔能还清

任何一个从样本算出来的数,都可以拆成三块:

估计值  =  真值  +  偏差  +  波动\text{估计值} \;=\; \text{真值} \;+\; \text{偏差} \;+\; \text{波动}

波动 是上一篇讲过的“晃动”:同一套流程重来一遍,谁被抽到、谁点了按钮,都是偶然的,这次高一点、下次低一点。它的尺度大致按 1/n1/\sqrt{n} 缩小——样本量翻四倍,晃动减半 1。关键在它 对称:多抽几批,高的和低的会互相抵消,平均起来中心落回真值附近。所以波动是能靠样本量还清的账。

偏差 不是“这次高了、下次低了”,而是 永远朝同一个方向偏。它的来源是选样本、收样本的方式:人群里有一部分人比别人更占“被算进数据”的优势,于是数据里的构成和真实人群不一样。方向固定,多抽几批不会互相抵消,平均完还是偏。

两笔账放一起看就清楚了。假设真实支持率是 40%,但你的名单让某一类人多进来一些,造成 +10 个百分点的偏差:

样本量波动范围(约)你会报出的数真实值
1,000±3 个百分点50%40%
250,000±0.2 个百分点50.0%40%

样本量涨了 250 倍,波动从 ±3 缩到 ±0.2,看上去精确多了;可中心仍然是 50%,离 40% 还差 10 个百分点。样本量扩大的是精确度,不是准确度。 更麻烦的是:样本量越大,你给出的波动范围越窄,越容易理直气壮地宣布一个错得离谱的数字。大样本碰上偏差,得到的不是“更接近真相”,而是“更确定地远离真相”。

偏差从哪来:三种“谁被算进了数据”

偏差的根都不在数字本身,而在“这份数据里的每个人,被算进来的机会是不是一样”。

名单本身就不全。 抽样是在一份名单上做的,可名单未必覆盖你要研究的人。《文学文摘》的名单主要来自电话簿和汽车登记册;那个年代装得起电话、买得起车的人偏富裕、偏年长、偏共和党 12。名单外的人不是“抽不到”,而是 根本没机会被抽到。今天同理:只统计 App 用户,就自动排除了卸载过的人;只统计注册用户,就排除了没注册成功的访客。

被抽到的人回不回答。 这是《文学文摘》翻车的另一半原因,可能还是更大的一半。一千万张明信片只收回 240 万份,回信率约四分之一;后来用 1937 年的盖洛普数据反查发现,没回信的人里支持罗斯福的是绝对多数 1。不是名单缺人,而是被邀请的人里,某一类更愿意开口。这叫无应答偏差,也叫自我选择偏差。同一件事天天在身边发生:App 商店评分来自愿意评分的人;满意度问卷发在用完服务那一刻,最不满意的顾客早就退出了。

你只看得见活下来的。 二战时统计学家亚伯拉罕·瓦尔德研究给轰炸机加装甲。他手上的数据是飞回来的飞机身上的弹孔——机身弹孔最密,发动机附近反而很少。直觉是加固机身,瓦尔德的判断相反:敌人开火大致均匀撒在飞机上,发动机弹孔在数据里异常地少,说明 发动机中弹的飞机没能飞回来,所以发动机才是要害 3。这个故事的流传版本简化了不少细节,但机制是真的:当数据只来自“活下来的人”,没进来的样本不是随机缺失的,而是 被你要研究的那个结果筛掉的。你统计留下用户的满意度,走掉的人的意见永远不会出现在表里。

绘制中

三条路的共同点:被漏掉的人并非随机,而是跟你要测的东西有关系。随机缺失(今天谁没接电话纯属偶然)会归到波动里;有方向的缺失才变成偏差。

怎么判断错的是哪一笔

多抽几批,中心会不会动? 波动让每批结果在中心附近跳,综合起来中心稳定;偏差让中心整体平移。最省事的做法是 换一个渠道再算一次:同一件事分别在 App 内问卷、邮件、电话里问。渠道一换中心就大幅移动,你面对的是偏差。

误差是不是总朝一个方向? 《文学文摘》连续几届都偏向同一个党,这就是偏差的签名 2。把数据按时间、地区切开,如果误差反复站同一边,别再指望“样本再多点就准了”。反过来也要记住:波动范围只管住了波动那一笔账,它对偏差一无所知,所以区间窄不等于对。

边界:偏差不是没救,但更难还

偏差有办法减小,只是成本更高、把握更小。常见做法是事后按已知的人群构成加权——发现样本里某类人偏多,就给他们调低权重。这不是空想:研究者用《文学文摘》里问到的 1932 年投票回忆重新加权,就能把胜者预测对 2。但要注意两点:加权只能按 你已经测量到、并且知道真实比例 的变量做;而且即便加权后预测对了胜者,票差依然偏得很厉害 2。

对日常工作的建议就一句:波动大,去加样本量;怀疑偏差,去改数据是怎么来的——补上漏掉的人,让沉默的人说话,或者在结论里直说自己排除了谁。

最后别走到另一个极端。样本量依然重要,它压住的波动是实打实会误导决策的。只是《文学文摘》的教训不是“大样本没用”,而是 在你确认数据里的人都该被算进来之前,样本量只放大了你的自信。