1. 一个具体问题
使用培训资料的人表现更好,是资料帮助了他们,还是本来更积极的人更愿意学习?如果由参与者自己选择是否使用,两组可能在动机、经验和时间上早就不同。随机对照实验尝试从分配机制上减少这种不可比性。
2. 一句话解释
随机把研究对象分配到不同处理条件,并比较结果,以估计特定情境中的干预效果。
3. 出处与原意
现代随机实验与 Fisher 等人的实验设计工作密切相关,随后广泛用于农业、医学和社会科学。线上 A/B 测试是其中一种应用,并不等于只要界面上写了 A 和 B 就实现了随机化。NIST 的实验设计手册把随机化与分组、区组等设计选择放在一起讨论。
4. 原理与机制
随机分配使已知与未知混杂因素在分配机制上得到平衡,但某次样本仍可能偶然不平衡。需要预先定义实验单位、处理、结果和分析规则,保持两组测量一致。按最初分配分析可回答“提供这项干预”的效果;仅比较最终遵从者,可能重新引入自我选择。
随机化单位应与干预传播方式一致。如果同一团队的人会互相交流新流程,按个人随机可能让对照组也受到影响。按团队分组可减少污染,却改变了有效样本量和分析方式。实验设计因此需要同时考虑分配、实际执行与结果测量,而非只调用一次随机函数。
5. 一个完整案例
假设案例:团队随机给两千名符合条件的用户分配新旧引导,各一千人。新组七天内完成关键操作的有 260 人,旧组 220 人,差异为四个百分点。接下来应计算不确定性,并核查分流是否失衡、日志是否漏报、新版是否同时改变其他功能。不能只留下新组中看完引导的用户,因为是否看完本身可能受能力与兴趣影响。实验结果对应的是这批用户、这个时间窗口和这个具体版本。
6. 适用条件与反例
适合干预可控制、伦理允许且能合理分组的场景。用户之间会互相影响时,个人随机化可能受到污染,需要考虑群组随机化。罕见长期结果、执行不一致和大量退出也会削弱结论。随机实验提高内部因果解释力,却不保证结论可推广到所有市场和时期。
7. 今天可以尝试的行动
为一个小改动写实验卡:谁有资格、按什么单位随机、唯一主指标、观察窗口、护栏指标及停止规则。上线前先用无功能差异的分流检查日志与样本比例,确认测量链路可靠。
8. 参考资料与关联条目
- NIST:Choosing an experimental design:随机化与设计选择。
- 关联阅读:相关不等于因果、选择偏差。