9.3 贝叶斯定理
第 9.2 节已经说明,条件的方向很重要。P(E∣H) 问的是“假设 H 成立时,证据 E 出现的可能性有多大”;P(H∣E) 问的则是“看到证据以后,假设 H 有多可信”。这两个概率通常并不相等。
当我们根据观察结果判断隐藏原因时,这种区别随处可见:
- 某种健康状况可能导致检测阳性;
- 某台故障机器可能生产出次品;
- 某类邮件来源可能产生特定词语;
- 某种隐藏策略可能产生可见行动。
贝叶斯定理把第一个方向的条件概率转换成第二个方向。
是表示某个潜在解释的事件。令 H 表示“此人具有某种状况”,令 E 表示“检测结果为阳性”。
四个量承担不同角色:
- P(H) 是,表示观察 E 之前 H 成立的概率。
- P(E∣H) 是,表示在 H 成立时观察到证据 E 的概率。
- P(E) 是,表示总体上出现 E 的概率。
- P(H∣E) 是,表示观察 E 以后更新得到的 H 的概率。
这些名称只是描述一次更新中不同位置的量,并不是四条新的概率法则。
乘法公式可以按两个顺序计算同一个交集:
P(H∩E)=P(H)P(E∣H) 以及
P(H∩E)=P(E)P(H∣E). 令等式右侧相等,并在 P(E)>0 的前提下除以 P(E),得到
P(H∣E)=P(E)P(E∣H)P(H). 这就是。可以把它的结构读成:
后验=证据概率似然×先验. 分子 P(E∣H)P(H) 就是 P(E∩H),表示同时属于假设和证据的概率质量。再除以全部证据质量 P(E),相当于把注意力限制在证据已经出现的情况中。
题目通常不会直接给出 P(E)。假设两个假设中恰有一个成立:H 或它的补事件 Hc。证据可以沿两条路线出现:
E=(E∩H)∪(E∩Hc). 这两部分互斥,所以概率可以相加。分别对两条路线使用乘法公式,就得到:
P(E)=P(E∣H)P(H)+P(E∣Hc)P(Hc). 把它代入贝叶斯定理:
P(H∣E)=P(E∣H)P(H)+P(E∣Hc)P(Hc)P(E∣H)P(H). 现在,每一项都对应一条能够产生证据的路线。
假设已知:
- 总体中有 1% 的人具有某种状况,因此 P(H)=0.01;
- 在具有该状况的人中,检测有 90% 的概率呈阳性,因此 P(E∣H)=0.90;
- 在不具有该状况的人中,检测有 95% 的概率呈阴性。
最后一个比例叫作。使用贝叶斯公式时,需要先把它转换成假阳性概率:
P(E∣Hc)=1−0.95=0.05. 我们可以直接代入小数,不过把总体想象成具体人数更容易看清分母。设想有 10,000 人:
| 人群 | 人数 | 阳性 | 阴性 |
|---|
| 具有该状况 H | 100 | 90 | 10 |
| 不具有该状况 Hc | 9,900 | 495 | 9,405 |
| 合计 | 10,000 | 585 | 9,415 |
在 585 个阳性结果中,只有 90 个是真阳性。因此,
P(H∣E)=58590=396≈0.1538. 后验概率约为 15.38%,并不是 90%。检测的 90% 灵敏度是 P(E∣H),而不是 P(H∣E)。先验比例很低,意味着“不具有该状况”的人群非常大;即使假阳性率只有 5%,这个大群体仍会产生许多阳性结果。这就是。
调整虚拟总体的患病率、灵敏度和特异度。人群会被分成真阳性、假阳性、假阴性与真阴性,使后验概率直接表现为“全部阳性中的一部分”,而不是一个没有来由的公式结果。
隐藏原因可能不止两个。若事件 H1,H2,…,Hk 两两互斥,并且合起来覆盖整个样本空间,就称它们构成 Omega 的一个:
Hi∩Hj=∅(i=j),i=1⋃kHi=Ω. 并集公式表示至少有一个假设发生;两两互斥表示不会有两个假设同时发生。
证据概率等于所有可能证据路线之和:
P(E)=i=1∑kP(E∣Hi)P(Hi). 求和符号 ∑ 表示把下标 i 从 1 到 k 的每一项相加。对于某个特定假设 Hj,贝叶斯定理写成
P(Hj∣E)=i=1∑kP(E∣Hi)P(Hi)P(E∣Hj)P(Hj). 例子:定位生产次品的机器
一家工厂的全部零件由三台机器生产:
| 假设 | 产量占比 | 次品概率 |
|---|
| H1:机器 1 | 0.50 | 0.01 |
| H2:机器 2 | 0.30 | 0.02 |
| H3:机器 3 | 0.20 | 0.04 |
令 D 表示证据“随机选中的零件是次品”。先计算每条路线贡献的联合概率:
P(D∩H1)P(D∩H2)P(D∩H3)=0.50⋅0.01=0.005,=0.30⋅0.02=0.006,=0.20⋅0.04=0.008. 再把三份贡献相加:
P(D)=0.005+0.006+0.008=0.019. 最后,用机器 3 的贡献除以全部次品概率:
P(H3∣D)=0.0190.008=198≈0.4211. 机器 3 只生产全部零件的 20%,却产生约 42.11% 的次品,因为它自身的次品率更高。
完成一次更新后,后验概率可以成为下一条证据到来前的新先验。假设先观察到 E1,再观察到 E2,更新过程是
P(H)⟶P(H∣E1)⟶P(H∣E1∩E2). 进行第二步时,需要知道在各个假设下,已经考虑 E1 后再出现 E2 的概率。如果模型明确规定,在给定 Hi 后 E1 与 E2 条件独立,那么联合似然可以分解:
P(E1∩E2∣Hi)=P(E1∣Hi)P(E2∣Hi). 表示在“Hi 已经成立”的受限世界中,两个事件相互独立。这是一条额外的模型假设,并不是贝叶斯定理自动保证的事实。如果固定假设以后两条线索仍会互相影响,直接把各自的似然相乘就会错误计算证据。
在三名嫌疑人之间展开调查,并按任意顺序选择线索。每条线索都会重新分配后验概率柱。案件板会公开先验、每个似然乘数和归一化过程,而且看似矛盾的新证据可以推翻先前的判断。
1. 定义假设事件与证据事件。 2. 检查这些假设是否构成划分。 3. 按正确方向记录每个先验 P(Hi) 与似然 P(E∣Hi)。 4. 相乘得到每条路线的联合贡献 P(E∩Hi)。 5. 把所有贡献相加,得到 P(E)。 6. 用目标路线的贡献除以证据总概率。 7. 检查所有后验概率都在 0 与 1 之间,而且总和为 1。
贝叶斯定理更新的是事件的概率。第 9.4 节将引入另一种工具:随机变量会给每个结果附上一个数值,从而描述概率分布与长期平均值。