1. 一个具体问题

一条异常告警声称能够识别九成故障。告警响起后,系统真的发生故障的概率就是九成吗?如果故障极少见,即使正常系统只有很小的误报率,大量正常请求也可能贡献更多告警。判断告警是否可信,需要把识别能力与故障原本有多常见放在一起。

2. 一句话解释

贝叶斯定理把已有概率与新证据结合起来,计算看到证据之后应如何更新判断。

3. 出处与原意

这一结果与 Thomas Bayes 身后发表的概率论文相关,后由 Laplace 等人发展。今天使用的公式是条件概率的直接推论,不只属于某一种统计学派。把它称为“相信什么就能证明什么”误解了先验的作用:先验也要接受数据、领域知识和敏感性检验的约束。

4. 原理与机制

设 H 是故障,E 是告警,则 P(H|E)=P(E|H)P(H)/P(E)。分母要包含所有可能产生告警的来源。若只分故障与正常两类,分母就是 P(E|H)P(H)+P(E|非H)P(非H)。计算前先统一样本单位和时间窗口,否则把“每天故障率”与“每次请求误报率”混用,公式正确也会得出错误答案。

实际使用时,还要让先验概率与检测对象匹配。如果这次检测面向已经出现症状的设备,就不能继续使用所有设备的平均故障率。检测准确率也可能随环境和阈值变化。贝叶斯更新并非机械地相信某个先验,而是把原来的判断与新增证据放在同一套概率口径中,让改变判断的原因可以被检查。

5. 一个完整案例

假设案例:检查一万台设备,故障率为 1%,检测对故障的识别率为 90%,对正常设备的误报率为 5%。预计 100 台故障中有 90 台告警;9900 台正常设备中有 495 台告警。告警总数为 585,真正故障所占比例约为 90/585=15.4%。因此,告警适合作为进一步检查的入口,不能直接替代诊断。若筛查人群变成高故障风险设备,后验概率也会改变。

6. 适用条件与反例

它适合诊断、质量检查、证据汇总等具有明确事件定义的场景。难点常在输入质量,而非代数。重复收到同一原始消息的转述,不能当成多份独立证据连续相乘。先验为零的事件在标准更新中仍为零,因此不应随意把“暂未见过”写成“不可能”。模型遗漏某种故障时,漂亮的后验也无法替遗漏负责。

7. 今天可以尝试的行动

找一条自己常看的告警,写出基准发生率、漏报率和误报率;再用一万人或一万次请求画人数表。若其中任何数字不清楚,先记录不确定区间,不急着输出精确概率。

8. 参考资料与关联条目