1. 一个具体问题

同一个实验没有提升总转化,却在城市、设备、年龄、渠道等几十个切片中找到一个显著上涨的群体。团队想立刻围绕它制定策略,但尝试过多少次比较,决定了这个“惊喜”有多容易偶然出现。只展示最好看的结果会遮住搜索过程。

2. 一句话解释

同时或反复检验许多假设时,即使每次门槛相同,至少出现一次误报的整体风险也会增加。

3. 出处与原意

多重比较属于统计推断中的经典问题,Bonferroni、Tukey 等方法服务于不同目标。NIST 手册强调,没有一种方法在所有比较任务中都最佳。需要区分控制“至少一个假阳性”的家族错误率,和控制被判显著结果中错误比例的发现率目标。

4. 原理与机制

如果二十个真实零假设的检验相互独立,每次误报率为 5%,至少误报一次的概率为 1−0.95²⁰≈64.2%。这不是说所有显著结果都有六成概率错误,而是在指定条件下描述整组检验。Bonferroni 将整体阈值 α 分给 m 次比较,每次用 α/m;它不要求检验独立,但比较多时可能保守。

除了控制“至少出现一次假阳性”的家族错误率,也有方法控制发现集合中的错误发现率。两者回答的问题不同,适用场景也不同。探索阶段可以筛选线索,但应标明探索性质,并在独立数据上验证;不能把筛选后最漂亮的结果当作事先提出的唯一假设。

5. 一个完整案例

假设案例:团队事先确定探索二十个用户分组,并希望控制整组 5% 的误报风险。简单 Bonferroni 门槛是 0.05/20,即 0.0025。某分组的 p 值为 0.03,不能据此通过该整体规则。团队仍可把它当成一个待验证线索,在新的独立样本中预先指定该分组与指标进行检验。新的验证与在旧数据里继续寻找证据有本质区别。

6. 适用条件与反例

适合多指标实验、分组分析和大规模筛选。并非所有探索都必须停止:探索可以帮助产生假设,但需要明确其身份并报告搜索范围。相关指标下独立公式不适用;不断追加未记录的比较,更会使校正失去依据。校正也不能修复错误抽样或有偏测量。

7. 今天可以尝试的行动

为一个分析建立“尝试清单”,记录查过的指标、分组和模型。将事先确认的主检验与探索发现分开,给重要发现安排独立验证,而不是删掉没成功的比较记录。

8. 参考资料与关联条目