1. 一个具体问题

新页面的转化率比旧页面高了两个百分点。它可能真的更好,也可能只是随机分组后的偶然波动。假设检验让这种判断有一套事先约定的规则,但如果把一个 p 值当成“方案成功概率”,这套规则反而会制造虚假的确定感。

2. 一句话解释

假设检验衡量数据与预设零假设及统计模型的相容程度,并按约定规则控制某类错误。

3. 出处与原意

现代检验结合了 Fisher 显著性检验和 Neyman–Pearson 决策理论等传统,两者关注点并不完全相同。美国统计协会在 2016 年发表 p 值声明,特别澄清统计显著不等于效应重要,也不等于假设为真的概率。使用工具前,应先弄清自己要做证据评估还是重复决策。

4. 原理与机制

先确定零假设、替代假设、统计量、样本量和显著性水平。p 值是在零假设和模型成立时,出现至少同样极端数据的概率。它不是“结果由偶然造成的概率”。未拒绝零假设,也不等于证明没有差异;样本不足或测量噪声大都可能让检验缺乏发现能力。

分析之前还要写清检验方向、停止规则和主要指标。如果看到数据后才选择单侧或双侧检验,或在许多指标中只挑最显著的一项,原先的错误率解释会被破坏。未拒绝零假设只表示当前证据不足,不能直接写成“两种方案完全等效”;证明近似等效需要另定实际差异边界。

5. 一个完整案例

假设案例:A、B 两组各随机分配一千名用户,分别有 100 与 120 人转化。差异是两个百分点。按简单独立二项样本近似,零假设下合并比例为 11%,差异标准误约为 √(0.11×0.89×0.002)=1.40 个百分点,z 值约为 1.43,双侧 p 值约 0.15。在事先设定的 5% 门槛下,不拒绝无差异假设,但不能说两版本相同;应结合区间和预定样本计划解释。

6. 适用条件与反例

适用于问题与分析规则明确、假设有合理依据的研究。看见结果后改成单侧检验、删掉不利人群或反复查看直到显著,都会让错误率偏离原设定。超大样本还可能让极小差异显著,因此必须同时报告效应量、成本和实际意义。

7. 今天可以尝试的行动

下次实验前写一页分析约定:主指标、比较方向、最小有意义效应、样本计划和停止规则。实验结束后同时给出估计值、区间及 p 值,避免只留下红绿灯式结论。

8. 参考资料与关联条目