1. 一个具体问题

产品团队给使用超过三十天的用户发问卷,九成回答“很容易上手”。可与此同时,新用户流失严重。问卷可能如实反映了受访者感受,却错过了最难上手、早早离开的人。数据没有撒谎,调查入口却已经替答案做了选择。

2. 一句话解释

当进入分析样本的机制与所研究的因素或结果有关时,样本中的关系可能偏离目标总体。

3. 出处与原意

选择偏差是抽样与因果推断中的一类问题,不应归为某位作者发明的单一定律。Hernán 与 Robins 的《Causal Inference: What If》从因果结构解释了选择如何制造或改变关联。实践中,抽样框缺漏、自愿回应、退出随访等都需要分别分析。

4. 原理与机制

先明确想回答的是谁的问题,再检查谁能进入数据。若进入样本同时受两个变量影响,只分析入选者可能让原本无关的变量看起来有关,这常称为碰撞点偏差。加大样本量只能减少随机波动,不能自动修复有方向的遗漏;加权也依赖入选概率可估计、关键群体没有完全缺失等前提。

补救办法与偏差来源有关。可以改变抽样入口、追踪未回应者,或在有合理假设时进行加权;但加权只能处理已观察且建模正确的选择差异。若决定参与调查的关键因素根本没有记录,给样本加上精确权重也不保证恢复总体真相。

5. 一个完整案例

假设案例:一百名新用户中,四十人觉得简单,六十人觉得困难。简单组有三十六人继续使用,困难组只有六人留下。若只问四十二名留存用户,“觉得简单”的比例为 36/42,约 85.7%;而全部新用户中只有 40%。团队据此取消新手引导,反而可能加重最需要帮助的人群的流失。更好的设计是在首次使用阶段抽样,并记录后续退出,而不是只从活跃名单中抽取。

6. 适用条件与反例

它适用于所有从有限记录推断更大群体的场景。但样本与总体不同,不意味着数据完全无用:只要清楚描述条件人群,仍可回答该人群的问题。反例是研究资深用户的快捷键需求,本就无需让新手占同样比例。真正要避免的是目标群体与采样机制未经说明地发生变化。

7. 今天可以尝试的行动

给当前数据画一条进入路径:被覆盖、被邀请、愿回应、记录完整、进入分析。为每一步写下可能被排除的人,并选最关键的一步补采样或做敏感性分析。

8. 参考资料与关联条目