1. 一个具体问题

一份样本的中位数很容易算,但它有多稳定却不容易直接套公式。重新收集几百份数据成本很高,能否利用现有样本模拟“如果重新抽样,统计量会怎样变化”?自助抽样提供了一条计算路线,但不会凭空创造原样本没有的信息。

2. 一句话解释

自助抽样从已有样本中有放回地重抽样,利用统计量的重复变化近似估计不确定性。

3. 出处与原意

Bradley Efron 在 1979 年的论文《Bootstrap Methods: Another Look at the Jackknife》中系统提出这一方法。它与更早的删一法有关,但并非同一种重抽样方式。后来发展出参数、自适应区间、分块等多种版本,适用条件各有不同。

4. 原理与机制

最基本的非参数版本把观测样本当作经验分布:原样本有 n 条,每轮有放回抽 n 条,计算目标统计量,重复很多轮,再估计标准误或构造区间。次数增加只能减少重抽样的数值误差。百分位区间易理解,但偏差、偏斜或特殊统计量可能需要更合适的方法。

重抽样时应抽取完整观测单元。如果每位用户同时有消费额与停留时长,应把这一对数值一起抽走,否则会破坏关联结构。比较两组时,要根据原始设计保留配对或分组关系。计算速度再快,也不能替代对“哪些记录可以互换”的判断。

5. 一个完整案例

假设案例:五个任务时长为 2、3、3、5、7 天,原均值为 4 天。一轮重抽样可能得到 2、2、3、5、7,均值为 3.8;另一轮可能为 3、5、5、7、7,均值为 5.4。大量重复后,可观察均值对样本组成的敏感程度。五个样本仍然太少,尤其无法代表从未观察到的极慢任务,因此这个演示只说明操作步骤,不能据此声称交付风险已被充分估计。

6. 适用条件与反例

常用于难以解析计算的统计量,但不适用于任何数据。时间序列应保留依赖结构,直接打散每日数据会低估不确定性;用户内多条记录也不能总当独立样本。估计分布上界、极端尾部,或样本严重偏斜缺失时,普通 bootstrap 可能失效。它不能补救选择偏差。

7. 今天可以尝试的行动

用一份可重复的数据集分别计算解析标准误与 bootstrap 标准误,先确认简单情形下两者大体一致。再记录重抽样单位、次数、随机种子和区间方法,使其他人能够复现。

8. 参考资料与关联条目