1. 一个具体问题
一次调查得到平均满意度 82 分,另一份调查得到 84 分。若第一份只有十名受访者、第二份有一千人,两个数字的稳定程度显然不同。只报一个点估计,会让读者把抽样波动误认为真实差异;置信区间提供了表达估计精度的一种方式。
2. 一句话解释
置信区间是按固定程序构造的区间,该程序在重复抽样中以指定比例覆盖目标参数。
3. 出处与原意
频率学派的置信区间理论与 Neyman 的工作密切相关。NIST 统计手册强调,95% 描述的是构造程序的长期覆盖率,不是已算出的某个区间给固定参数分配了 95% 的概率。贝叶斯可信区间使用另一套解释,不能只因为两者数值相近就混为一谈。
4. 原理与机制
对独立正态样本、总体标准差未知的均值估计,常用形式为 样本均值±t临界值×样本标准差/√n。区间随波动变大而变宽,随样本增多而通常变窄。提高置信水平也会扩大区间。每一种公式都有条件,均值、比例、预测下一次观测分别需要不同方法。
报告时最好同时保留点估计、上下界和单位,避免只说结果“有把握”。窄区间可能排除零,却仍对应微不足道的实际差异;宽区间包含零,也可能同时包含业务上很重要的影响。这两种情况需要不同后续行动,不能都压缩成一次二选一的显著性标签。
5. 一个完整案例
假设案例:一百次独立测量的平均耗时为 50 毫秒,样本标准差为 10 毫秒。若采用近似 t 区间,99 个自由度的 95% 临界值约为 1.984,得到 50±1.984×10/10,即约 48.02 至 51.98 毫秒。区间反映总体平均耗时的估计,不表示下一次请求有 95% 概率落在这个约四毫秒宽的范围内。单次请求的波动通常大得多。
6. 适用条件与反例
适合报告估计精度,但只能覆盖模型所表达的不确定性。若抽样漏掉慢请求、时钟测量存在偏差,即使区间很窄也可能整体偏离真实值。两个区间是否重叠不是通用的差异显著性检验。反复查看数据直到区间满足要求,也会改变原本固定样本程序的覆盖性质。
7. 今天可以尝试的行动
给一项业务指标补上区间说明:目标参数、样本来源、方法、置信水平和主要假设。然后问一句“业务上最小有意义的差异是什么”,把统计精度与实际决策需求联系起来。
8. 参考资料与关联条目
- NIST:What are confidence intervals?:覆盖率及单侧、双侧区间。
- NIST:Confidence Limits for the Mean:均值区间与解释。
- 关联阅读:中心极限定理、假设检验。