会议里常见的一幕:有人把一张柱状图投到屏幕上,指着说“看,A 比 B 高”。然后房间安静下来,因为没人知道接下来该做什么。图上的数字没错,但这场会议并没有得到结论。

这不是画图的错。图只负责告诉你数据长什么样,它本来就不负责给结论。这一篇讲清楚的是:从一张图到一个能真正拿去用的结论,中间到底缺了什么。

一次分析到底在回答什么

图回答的是“数据长什么样”,结论回答的是“我们该做什么”。这是两个不同的问题。

每一个值得做的分析背后,都藏着一个决策问题——要不要做某件事,或者在两三个选项里挑哪个。比如下个月的投放预算往哪投。“销量最近在涨”不是决策问题,“要不要为这个增长多招两个人”才是。

把这条线拉直,一次分析的样子是这样的:

决策问题 → 可比较的数据问题 → 取数 → 证据 → 结论 → 行动

图只是中间“证据”那一环里的一帧画面,它本身既不是结论,也不是行动。所以判断一个分析有没有做完,有个很直接的办法:如果这件事做完,没有人需要因此改变什么,那它多半只是监控,还不是分析 5

从图到结论,缺的三样东西

用一个贯穿的例子来看。你在两个渠道投放,看板给出了这些数:

渠道点击注册转化率
A20084.0%
B2000603.0%

图上 A 的柱子确实高一点。很多人到这一步就停下,直接说“A 更好”。要变出结论,还得补上三样东西。

缺口一:数字要有基准

4.0% 单独摆在那里,什么也不说明。它必须和一个参照物比才有意义:和上个月比、和目标比、和其他渠道比。没有基准,图就只是一个带坐标轴的标签 1

同样重要的是,基准是你选的,而这个选择本身就带着判断。和上月比是问“我们有没有进步”,和目标比是问“我们离计划还差多远”。这两个问题不一样,答案也可能相反。所以基准不能默认,要说出来。

缺口二:差异要能大过波动

这是最容易被跳过的一步。数据永远在晃。同一批人、同一套流程,重来一次,结果不会完全一样。你在 200 个访客里数到 8 个注册,换一批 200 个访客来数,可能是 4 个,也可能是 14 个。这种晃动不需要任何人做错什么,它只是取样的固有性质,也没法彻底消除 4

一个熟悉的直觉:抛 100 次硬币,正面出现 40 到 60 次都算正常。所以如果 100 次里出现 45 次正面,你不能说这枚硬币不均匀——那是波动。

对比例这种数字,晃动的尺度大致和样本量的平方根成反比:

波动尺度1.96p(1p)n\text{波动尺度} \approx 1.96\sqrt{\frac{p(1-p)}{n}}

不用记公式,只要看两处:分母里的 nn 说明样本越大晃得越小;而 nn 在根号里,说明样本量翻四倍,晃动才减半 3。用具体数字感受一下(都按 3% 算):

  • 100 次点击里 3 次注册,得到的 3% 上下大约晃 ±3 个百分点,真实水平可能是 0% 到 6%;
  • 1000 次点击里 30 次注册,还是 3%,但只晃 ±1 个百分点左右 2

样本越大,这个数越敢信。

现在回到例子。A 只有 200 次点击,4.0% 这个数上下大约晃 ±2.7 个百分点,真实水平落在 1% 到 7% 之间。B 的 3.0% 正好落在这个范围里。也就是说,“A 比 B 好”这句话,眼下的证据根本撑不住——你看到的高低差,完全可能只是晃动。

这时你有两个正经选择:要么再收集数据,要么把结论如实写成“目前看不出两个渠道的差别”。后一句听起来不够有力,但它是真的。

有一个边界要说清楚:上面这个估算假设每个访客彼此独立、来源可比,而且你投出去的这 200 次点击,足以代表这个渠道平时的表现。如果 A 和 B 面对的根本不是同一类人,那属于另一个问题,不是波动能解释的。

缺口三:差异要接得上决策

假设数据够了,也确认 A 确实更好,那是不是就该把预算全给 A?先看总量。

A 现在 200 次点击带来 8 个注册,B 用 2000 次点击带来 60 个。转化率是效率,业务目标往往是总量。如果把预算全挪到 A,却拿不到同等流量,总注册数反而会掉。一个更高的比例,不等于更多的结果。

所以结论最后必须落回决策:我要做哪个选择,这么做值不值。

一个能拿去用的结论长什么样

上面三样东西,可以整理成四个自查问题:

  1. 和谁比? —— 基准是什么,为什么选它;
  2. 差多少,会不会只是波动? —— 给出大小,并说明它有没有超过晃动范围;
  3. 在什么范围内成立? —— 哪些人、哪个时段、哪种渠道;
  4. 它改变了哪件事? —— 指向一个具体行动,并交代代价和收益。

拿这四条检验刚才的例子。一句不能用的结论长这样:

A 渠道转化率 4%,高于 B 渠道的 3%,建议加大 A 的投放。

每个数字都对,但它省掉了波动检查、省掉了适用范围,也省掉了总量这笔账。能用的是:

A 渠道目前的转化率看起来更高(4.0% 对 3.0%),但 A 只有 200 次点击,这个差距还在随机波动范围内,暂时不足以证明 A 更优。建议先把 A 的投放量提到和 B 相当(约 2000 次点击),再比一次;如果差距还在,再考虑把预算向 A 倾斜。

第二句长很多,但多出来的每一个字,都是在补上前面缺的那几样东西。

两句容易说过头的话

第一句是因果。“用 A 就能提高转化率”比“A 渠道的转化率更高”说得远了一步。也可能是你投 A 的时候只挑了高意向人群,那差异来自人群而不是渠道。基准能帮你比较,但它本身不能证明原因 1

第二句是尺度。只有方向没有大小,也不算结论。“显著提升”到底是提升了 0.1 个百分点还是 10 个百分点?这两个结论会导出完全不同的行动。

收尾

不是每次分析都要跑一遍统计检验。决定午饭吃什么,不需要严格抽样。但这个取舍你得知情:省掉波动检查,就要把结论说成“看起来”,而不是“确实”;省掉范围说明,就要说清楚它可能只在这批数据上成立。

一个最快的自检问题:如果这个结论是错的,我会不会因此做错决定?如果是,那就说明还缺一步没走完。