形式陈述
设随机变量 $X:(\Omega,\mathcal F,\mathbb P)\to(S,\mathcal S)$ 可测。$X$ 的概率分布或律是推前测度
$$ \mathcal L(X)=\mathbb P\circ X^{-1}, \qquad \mathcal L(X)(A)=\mathbb P(X\in A),\quad A\in\mathcal S. $$它是 $(S,\mathcal S)$ 上总质量为一的测度。若 $X,Y$ 的分布相同,记作 $X\overset d=Y$;这只要求所有可测取值事件概率相同,不要求它们定义在同一概率空间或逐样本相等。
直觉
分布忘掉随机变量由哪个样本机制产生,只保留输出落入各可测集合的概率。许多概率计算因此可在取值空间上直接进行。
例子与边界
掷公平骰子的点数分布在 $\{1,\ldots,6\}$ 上各给质量 $1/6$。不同随机变量可以同分布但独立、相关甚至定义在不同空间。分布不一定有密度:离散分布含原子,Cantor 分布既无离散原子也不对 Lebesgue 测度绝对连续。联合分布包含变量间依赖信息,单独的边缘分布不能确定联合分布。
推论与应用
分布把随机变量连接到测度论;对非负或可积的可测函数 $g$,可用积分公式 $\mathbb E[g(X)]=\int_Sg\,d\mathcal L(X)$ 计算期望,并据此定义弱收敛、统计模型和生成采样。
参考资料
- Patrick Billingsley, Probability and Measure, 3rd ed., Wiley, 1995,Chs. 1–2, random variables and induced probability measures。
- Sheldon Ross, A First Course in Probability, 10th ed., Pearson, 2019,Ch. 4, random variables and probability laws。