1. 一个具体问题
团队比较两个流程,发现 A 在简单任务和复杂任务上的成功率都高于 B,但汇总后却是 B 更高。有人怀疑算错了,也有人想直接采用总表。事实上,两张表可能同时正确;真正的问题是两种流程承担了多少不同难度的任务。
2. 一句话解释
辛普森悖论是指分组比较中的方向,在不同权重的汇总后可能消失或反转。
3. 出处与原意
Edward Simpson 在 1951 年的列联表论文中讨论了相关问题,更早也有类似观察。它并不是逻辑矛盾,而是提醒人们:忽略分组结构可能改变正在回答的问题。判断该汇总还是分层,需要结合因果背景,不能机械地相信更细的表总是正确。
4. 原理与机制
总成功率是各组成功率按样本量加权的平均值。如果 A 大部分样本来自困难组,B 大部分样本来自容易组,两者的总率就包含难度差异。分组变量可能是混杂因素,也可能位于因果路径上,甚至是一个不宜控制的共同结果。单靠表内数字无法确定正确调整方式。
决定是否分组不能只看哪种结果符合期待,而要根据因果问题决定。如果分组变量本身受措施影响,机械控制它还可能引入新的偏差。报告时应同时给出各组分母、总体结果与分层依据,让读者看出组成变化,而不是从两种口径中挑选更好看的一个。
5. 一个完整案例
假设案例:简单任务中 A 成功 9/10,B 成功 80/100;困难任务中 A 成功 30/100,B 成功 2/10。A 在两组的成功率分别为 90% 和 30%,都高于 B 的 80% 和 20%。但 A 总体为 39/110,约 35.5%;B 为 82/110,约 74.5%。A 的高难度任务占比更大。若目标是比较同样难度分布下的表现,可以先确定统一权重;若目标是描述各自实际完成情况,原始汇总仍有意义。
6. 适用条件与反例
适用于转化率、通过率、质量与绩效报表的解释。它不说明每一次总体差异都是假象,也不许可在几十个切分维度中挑出最有利的一种。对实验数据,还要考虑分组是否发生在处理之后。为了得到想要的结论而随意分层,会把统计工具变成另一种选择偏差。
7. 今天可以尝试的行动
选一个总率明显变化的指标,按业务上事先合理的维度列出“分母、成功数、成功率”。检查究竟是组内表现变化,还是各组占比变化;汇报时同时展示二者。