1. 一个具体问题
读了十位成功创业者的经历,发现他们都敢于承担巨大风险,于是得出“大胆冒险就更容易成功”的结论。这里遗漏了哪些人?也许很多同样冒险的人已经退出行业,无法进入访谈名单。我们看到的成功样本,可能经过了一道与结果有关的筛选。
2. 一句话解释
幸存者偏差发生在只分析留下来的对象,却把结论推广到包含退出者的原始群体时。
3. 出处与原意
它是选择偏差的一种表现,而非只属于某个著名故事。金融研究中,Brown、Goetzmann、Ibbotson 与 Ross 在 1992 年分析过业绩研究中的幸存者偏差。理解这一问题,不需要把流传的战机故事当作唯一出处;更重要的是恢复样本的进入和退出规则。
4. 原理与机制
如果失败、关闭或表现差会让记录消失,当前可见样本就不再代表起点总体。缺失不是随机的,多收集一些当前成功者通常也无法修复。需要追踪起始名单、退出时间与退出前表现,并考虑数据提供方是否回填成功历史。统计时还要分清固定起点队列与不断纳入新对象的动态名单。
建立样本时,可以先固定某个历史时点的完整名单,再向后追踪所有成员,包括退出、失联与被合并者。不要从今天仍能找到的成功者倒推名单。若退出者的数据确实不可得,应明确缺失范围,并用不同退出表现的假设观察结论是否改变。
5. 一个完整案例
假设案例:十家店在年初各投入同样资金,五家存续店年底收益率均为 20%,五家关闭店各亏损 60%。只看仍营业的店,平均收益率为 20%;把全部十家算入,则为 (5×20%+5×−60%)/10=−20%。两份报告差了四十个百分点,原因不在计算公式,而在分母。若关闭店没有完整账目,也应说明缺失并做范围估计,不能悄悄删掉。
6. 适用条件与反例
适合检查职业建议、公司排名、基金回测与用户留存研究。只研究幸存者也可能合理,例如目标就是改善现有活跃用户的体验;问题在于把这个条件群体的发现外推到全部新用户。恢复失败样本也不会自动证明因果,还可能有能力、资源和时代环境等混杂。
7. 今天可以尝试的行动
审查一份成功经验总结,写出“谁有机会被看见,谁会消失”。找一组同起点的未成功对象,比较它们是否也具备被称为成功秘诀的特征,再决定这条经验能说明多少。
8. 参考资料与关联条目
- Brown 等(1992):Survivorship Bias in Performance Studies:业绩样本选择的原始研究。
- 关联阅读:选择偏差、基准率忽视。