9.4 离散随机变量与期望
前三节给事件赋予了概率。但在很多问题中,我们还关心一个数值后果,例如得分、收益、等待时间、错误数量或成功请求数量。随机变量负责把每个结果连接到这样的数值。
是以试验结果为输入、以数值为输出的函数。若样本空间为 Omega,一个实值随机变量 X 写作
X:Ω→R. 符号 R 表示实数集合。本节只需要知道,它允许 −2、0、3、1/2 之类的输出。
函数 X 的映射规则是固定的;不确定的是试验会产生哪个结果。因此,在试验发生前,X 的取值也不能确定。
例子:正面出现的次数
连续抛两次硬币,样本空间为
Ω={HH,HT,TH,TT}. 定义 X 为正面出现的次数,那么
X(HH)=2,X(HT)=X(TH)=1,X(TT)=0. 不同结果可以映射到同一个数值,HT 与 TH 都映射到 1。所以随机变量不仅是给结果换名字,它还可能把多个结果合并成同一个数值类别。
因为 X 只取彼此分离的数值 0,1,2,所以它是一个。本章只研究离散随机变量。
常简称为 ,它给出 X 等于每个可能数值的概率,定义为
pX(x)=P(X=x). 下标用于说明这个函数描述的是哪个随机变量,小写 x 表示一个可能的具体取值。
对于两次公平抛硬币:
| 取值 x | 映射到 x 的结果 | pX(x) |
|---|
| 0 | TT | 1/4 |
| 1 | HT,TH | 2/4=1/2 |
| 2 | HH | 1/4 |
合法的 pmf 必须满足两条规则。对于每个可能的 x,
pX(x)≥0, 而且
x∑pX(x)=1. 符号 ∑x 表示“把 X 的每个可能取值所对应的概率相加”。总和为 1,因为必定有一个取值出现。
对于任意数值集合 C,事件 X∈C 包含所有被映射到 C 中数值的结果。把对应的 pmf 项相加即可得到它的概率:
P(X∈C)=x∈C∑pX(x). 例如,
P(X≥1)=pX(1)+pX(2)=21+41=43. 离散随机变量 X 的写作 E[X],定义为
E[X]=x∑xpX(x). 把每个可能取值乘以它的概率,再把这些乘积相加。对于正面次数,
E[X]=0⋅41+1⋅21+2⋅41=1. 期望是模型预测的长期平均值。如果反复进行“两次抛硬币”试验,并对所有 X 的值求平均,这个平均值通常会逐渐稳定在 1 附近。
期望是随机变量能够实际取得的数值。公平骰子取值为 1 到 6 时,
E[X]=61+2+3+4+5+6=3.5, 但任何一次投掷都不会出现 3.5。应当把期望看成概率质量的平衡点,而不是预测下一次结果必定等于它。
假设一个游戏暂时不收入场费:公平骰子出现 6 时获得 8 积分,出现 5 时获得 2 积分,其他情况损失 1 积分。令 X 表示净收益,把收益相同的结果合并:
| 净收益 x | 对应骰子面数 | pX(x) | 贡献 xpX(x) |
|---|
| −1 | 4 | 4/6 | −4/6 |
| 2 | 1 | 1/6 | 2/6 |
| 8 | 1 | 1/6 | 8/6 |
所以
E[X]=6−4+2+8=1. 从长期平均看,玩家每局获得 1 积分。如果组织者收取 c 积分入场费,新净收益变量为 Y=X−c,其期望为
E[Y]=E[X]−c=1−c. 当净收益期望为 0 时,称游戏在。这里的公平入场费为 c=1。这种公平不表示每位玩家输赢相同,也不表示游戏风险很小;它只描述长期平均净收益。
给骰子的每个面分配收益,观察相同收益怎样合并成 pmf。加权天平会定位期望值,入场费控制器则能在不改变结果概率的情况下,让同一个游戏变得有利、公平或不利。
若固定数 a,b 满足 Y=aX+b,那么 X 的每个可能取值都会先乘以 a,再加上 b。期望遵循相同的变换:
E[aX+b]=aE[X]+b. 从定义可以直接看出原因:
E[aX+b]=x∑(ax+b)pX(x)=ax∑xpX(x)+bx∑pX(x)=aE[X]+b, 最后一步使用了 pmf 概率总和为 1 的事实。
对于事件 A,它的 IA 定义为
IA(ω)={1,0,若 ω∈A,若 ω∈/A. 这里的 ω 表示 Omega 中的一个结果。指示变量用 1 或 0 报告事件是否发生。
它的 pmf 只有两个取值:
P(IA=1)=P(A),P(IA=0)=1−P(A). 因此
E[IA]=1⋅P(A)+0⋅(1−P(A))=P(A). 这个简短等式非常有用:指示变量的期望就等于对应事件的概率。
对于期望有限的离散随机变量 X1,X2,…,Xn,
E[X1+X2+⋯+Xn]=E[X1]+E[X2]+⋯+E[Xn]. 这称为。这些随机变量不需要相互独立。
看看它如何用于计数。从 10 张卡片中不放回抽取 3 张,其中 4 张是红色。对于 j=1,2,3,定义
Ij={1,0,若第 j 个抽取位置上的卡片为红色,否则. 令 X 表示抽到的红色卡片总数,那么
X=I1+I2+I3. 由对称性,每个位置由红色卡片占据的概率都是 4/10,所以
E[Ij]=104. 现在使用期望的线性性质:
E[X]=j=1∑3E[Ij]=3⋅104=1.2. 这些抽取相互依赖,因为抽走一张红色卡片会改变剩余卡片。不过期望仍然可以直接相加。我们无需构造 X 的完整 pmf,也无需逐一统计每种三张卡片组合。
更一般地,如果 X 统计事件 A1,A2,…,An 中有多少个发生,可以写成
X=i=1∑nIAi. 于是
E[X]=i=1∑nP(Ai). 操作方法是:为每个对象或位置定义一个指示变量,把总数写成指示变量之和,用事件概率替换每个指示变量的期望,最后相加。
在胶囊牌组中装入成功标记,不放回抽取,并观察相互依赖的位置指示器怎样点亮或熄灭。多次探险会把模拟平均成功数与线性性质给出的精确结果进行比较,即使后续抽取概率会随着先前结果改变。
本章建立了一条连贯的概率工作流程:
1. 定义结果、样本空间与事件子集。 2. 在结果等可能时,用计数度量事件。 3. 新信息到来时限制样本空间,得到条件概率。 4. 检查信息是否改变概率,判断独立或依赖。 5. 用贝叶斯定理反转条件,更新隐藏原因的可信度。 6. 用随机变量把结果映射到数值,再用 pmf 与期望概括这些数值。 7. 把事件计数变成指示变量之和,并使用期望的线性性质。
第 10 章将开始研究树。条件概率中短暂使用的分支图会成为独立的数学对象,我们将系统学习它的严格性质、遍历方法与相关算法。