# 图看完了，结论在哪里：从一张图到一个能拿去用的结论

画完图只是拿到了证据，离结论还差基准、波动范围和行动指向这三步

> 数据分析流程 · 抽样误差 · 结论表达 · 约 6 分钟 · 09 月 22 日

## 本篇要点

1. 图描述的是数据长什么样，结论回答的是我们该做什么，两者之间隔着“证据”这一步。
2. 一次分析是从决策问题出发的：决策问题 → 可比较的数据问题 → 取数 → 证据 → 结论 → 行动；图只是证据中的一帧。
3. 数字必须有基准（上月、目标、其他渠道），而基准由人选，选哪个就等于在问哪个问题。
4. 数据天然会晃动：同样的过程重来一次，数字就不一样，所以看到差异不等于差异真实存在。
5. 对比例数字，晃动尺度约按 $1/\sqrt{n}$ 变化，样本量翻四倍晃动才减半；1000 次点击的估计约晃 ±1 个百分点，100 次则约晃 ±3 个百分点。
6. 例子中 A 只有 200 次点击，4.0% 的波动范围（约 1% 到 7%）覆盖了 B 的 3.0%，因此“A 更好”证据不足，只能说“目前看不出差别”。
7. 即使差异为真，也要看总量：转化率高但流量小，全部转移预算可能反而减少总注册数。
8. 能用的结论要交代基准、大小与波动、适用范围和指向的行动；“建议加大 A 投放”省掉了后面三项。
9. “用 A 就能提高转化率”比“A 的转化率高”多说了因果；只有方向没有大小也不算结论。
10. 最快的自检是：如果这个结论是错的，我会不会因此做错决定。

---

会议里常见的一幕：有人把一张柱状图投到屏幕上，指着说“看，A 比 B 高”。然后房间安静下来，因为没人知道接下来该做什么。图上的数字没错，但这场会议并没有得到结论。

这不是画图的错。图只负责告诉你数据长什么样，它本来就不负责给结论。这一篇讲清楚的是：从一张图到一个能真正拿去用的结论，中间到底缺了什么。

## 一次分析到底在回答什么

图回答的是“数据长什么样”，结论回答的是“我们该做什么”。这是两个不同的问题。

每一个值得做的分析背后，都藏着一个决策问题——要不要做某件事，或者在两三个选项里挑哪个。比如下个月的投放预算往哪投。“销量最近在涨”不是决策问题，“要不要为这个增长多招两个人”才是。

把这条线拉直，一次分析的样子是这样的：

**决策问题 → 可比较的数据问题 → 取数 → 证据 → 结论 → 行动**

图只是中间“证据”那一环里的一帧画面，它本身既不是结论，也不是行动。所以判断一个分析有没有做完，有个很直接的办法：如果这件事做完，没有人需要因此改变什么，那它多半只是监控，还不是分析 [5]。

## 从图到结论，缺的三样东西

用一个贯穿的例子来看。你在两个渠道投放，看板给出了这些数：

| 渠道 | 点击 | 注册 | 转化率 |
| --- | --- | --- | --- |
| A | 200 | 8 | 4.0% |
| B | 2000 | 60 | 3.0% |

图上 A 的柱子确实高一点。很多人到这一步就停下，直接说“A 更好”。要变出结论，还得补上三样东西。

### 缺口一：数字要有基准

4.0% 单独摆在那里，什么也不说明。它必须和一个参照物比才有意义：和上个月比、和目标比、和其他渠道比。没有基准，图就只是一个带坐标轴的标签 [1]。

同样重要的是，基准是你选的，而这个选择本身就带着判断。和上月比是问“我们有没有进步”，和目标比是问“我们离计划还差多远”。这两个问题不一样，答案也可能相反。所以基准不能默认，要说出来。

### 缺口二：差异要能大过波动

这是最容易被跳过的一步。数据永远在晃。同一批人、同一套流程，重来一次，结果不会完全一样。你在 200 个访客里数到 8 个注册，换一批 200 个访客来数，可能是 4 个，也可能是 14 个。这种晃动不需要任何人做错什么，它只是取样的固有性质，也没法彻底消除 [4]。

一个熟悉的直觉：抛 100 次硬币，正面出现 40 到 60 次都算正常。所以如果 100 次里出现 45 次正面，你不能说这枚硬币不均匀——那是波动。

对比例这种数字，晃动的尺度大致和样本量的平方根成反比：

$$\text{波动尺度} \approx 1.96\sqrt{\frac{p(1-p)}{n}}$$

不用记公式，只要看两处：分母里的 $n$ 说明样本越大晃得越小；而 $n$ 在根号里，说明样本量翻四倍，晃动才减半 [3]。用具体数字感受一下（都按 3% 算）：

- 100 次点击里 3 次注册，得到的 3% 上下大约晃 ±3 个百分点，真实水平可能是 0% 到 6%；
- 1000 次点击里 30 次注册，还是 3%，但只晃 ±1 个百分点左右 [2]。

样本越大，这个数越敢信。

现在回到例子。A 只有 200 次点击，4.0% 这个数上下大约晃 ±2.7 个百分点，真实水平落在 1% 到 7% 之间。B 的 3.0% 正好落在这个范围里。也就是说，“A 比 B 好”这句话，眼下的证据根本撑不住——你看到的高低差，完全可能只是晃动。

这时你有两个正经选择：要么再收集数据，要么把结论如实写成“目前看不出两个渠道的差别”。后一句听起来不够有力，但它是真的。

有一个边界要说清楚：上面这个估算假设每个访客彼此独立、来源可比，而且你投出去的这 200 次点击，足以代表这个渠道平时的表现。如果 A 和 B 面对的根本不是同一类人，那属于另一个问题，不是波动能解释的。

### 缺口三：差异要接得上决策

假设数据够了，也确认 A 确实更好，那是不是就该把预算全给 A？先看总量。

A 现在 200 次点击带来 8 个注册，B 用 2000 次点击带来 60 个。转化率是效率，业务目标往往是总量。如果把预算全挪到 A，却拿不到同等流量，总注册数反而会掉。一个更高的比例，不等于更多的结果。

所以结论最后必须落回决策：我要做哪个选择，这么做值不值。

## 一个能拿去用的结论长什么样

上面三样东西，可以整理成四个自查问题：

1. **和谁比？** —— 基准是什么，为什么选它；
2. **差多少，会不会只是波动？** —— 给出大小，并说明它有没有超过晃动范围；
3. **在什么范围内成立？** —— 哪些人、哪个时段、哪种渠道；
4. **它改变了哪件事？** —— 指向一个具体行动，并交代代价和收益。

拿这四条检验刚才的例子。一句不能用的结论长这样：

> A 渠道转化率 4%，高于 B 渠道的 3%，建议加大 A 的投放。

每个数字都对，但它省掉了波动检查、省掉了适用范围，也省掉了总量这笔账。能用的是：

> A 渠道目前的转化率看起来更高（4.0% 对 3.0%），但 A 只有 200 次点击，这个差距还在随机波动范围内，暂时不足以证明 A 更优。建议先把 A 的投放量提到和 B 相当（约 2000 次点击），再比一次；如果差距还在，再考虑把预算向 A 倾斜。

第二句长很多，但多出来的每一个字，都是在补上前面缺的那几样东西。

## 两句容易说过头的话

第一句是因果。“用 A 就能提高转化率”比“A 渠道的转化率更高”说得远了一步。也可能是你投 A 的时候只挑了高意向人群，那差异来自人群而不是渠道。基准能帮你比较，但它本身不能证明原因 [1]。

第二句是尺度。只有方向没有大小，也不算结论。“显著提升”到底是提升了 0.1 个百分点还是 10 个百分点？这两个结论会导出完全不同的行动。

## 收尾

不是每次分析都要跑一遍统计检验。决定午饭吃什么，不需要严格抽样。但这个取舍你得知情：省掉波动检查，就要把结论说成“看起来”，而不是“确实”；省掉范围说明，就要说清楚它可能只在这批数据上成立。

一个最快的自检问题：如果这个结论是错的，我会不会因此做错决定？如果是，那就说明还缺一步没走完。

## 术语表

- 决策问题：分析真正要回答的那个“该做什么”的问题，它决定了要看哪些数据。
- 基准：让一个数字获得意义的比较对象，可以是上月、目标、其他渠道或某个细分人群。
- 抽样波动：同一套过程重来一次，数字仍会不同，这部分差异不需要任何人犯错，也无法彻底消除。
- 波动尺度：一个估算值上下大约会晃动多大范围，按 $1/\sqrt{n}$ 随样本量缩小。
- 效率与规模：比例类指标衡量效率，业务目标常看总量，两者可能指向相反的行动。

## 来源

1. [From Question to Comparison to Chart — 先说出比较再选图，基准决定数字的含义](https://vishalsingh.org/ch03-question-to-chart)
2. [Terence Tao: Small samples, and the margin of error — 抽样只取决于样本绝对大小，n=1000 约 ±3%](https://terrytao.wordpress.com/2008/10/10/small-samples-and-the-margin-of-error/)
3. [STATS60 Lecture 16: Sample size matters — 估计值波动按 1/√n 缩小](https://tselilschramm.org/introstats/lectures/16-lecture-sizematters.html)
4. [Applied Biostatistics: Sampling Error — 抽样误差无法避免，小样本最易误导](https://ybrandvain.github.io/biostats/book_sections/sampling/sampling_error.html)
5. [IIBA: Stop Reporting Data, Start Telling Stories — context–insight–action，从决策出发](https://www.iiba.org/business-analysis-blogs/stop-reporting-data-start-telling-stories/)

---

原文：https://pangzhengboyin.com/articles/from-chart-to-usable-conclusion-cab7f453

> **庞征博引** · 想学的，慢慢都会
>
> 庞征博引是把想学的东西写成连载的 AI 学习工具。说出想学什么，它会先了解你的基础，再把主题写成一篇篇 5–10 分钟能读完的文章；边读边问，接下来学什么跟着你走。这篇就是这样写出来的。
>
> 开始你自己的连载 → https://pangzhengboyin.com
