“随机算法可视为 $\mathcal A c$ 上的分布 $\rho$,输入方的分布记为 $\mu$。两者相遇时的期望损失是”
形式陈述 ​
可测空间
分布可以直接在取值空间上指定,不必先给出生成它的物理实验。反过来,任何分布都能被某个随机变量实现:取概率空间
若随机变量
记号
直觉
分布是把随机变量的样本来源忘掉后留下的完整输出规律。它回答“输出会落入哪些可测集合,各有多大概率”,却不再记录某个输出由哪个样本点产生。许多不同实验可以实现同一分布,就像不同装置可以产生相同的测量直方图。
分布的本体是测度,密度曲线只在绝对连续情形下提供一种表示。离散分布由点质量描述,奇异分布则可能既没有点质量也没有 Lebesgue 密度;三者以及它们的混合都统一属于概率测度。表示方式的适用范围不同,底层对象并没有改变。
边缘分布足以计算只依赖一个变量的概率和期望,却不能回答两个变量怎样配对。要描述“同时出现”,必须给出联合分布。随机模拟若只复现每个变量的直方图,变量之间的依赖仍可能完全错误。
例子与边界
公平骰子的点数分布可直接定义在
实体骰子、均匀整数生成器,或更大样本空间上的分组映射,都可能推出同一个
相同边缘分布不能决定联合行为。令
分布未必有普通密度。离散分布含有正质量单点;Cantor 分布把全部质量放在一个 Lebesgue 零测集上,每个单点却仍为零。它的分布函数连续,但相对于 Lebesgue 测度不绝对连续。这说明“无原子”“CDF 连续”和“存在密度”是三个强弱不同的性质。
“均匀分布”必须说明空间与参考测度。有限集可归一化计数测度,有限长度区间可归一化 Lebesgue 测度;全体整数或整条实线上不存在平移不变、总质量为一的均匀概率分布。把“没有偏好”当成自动存在的分布,往往是在隐藏一个尚未指定的参考结构。
推论与应用
实直线上的分布可由分布函数唯一编码;只有对某个参考测度绝对连续时,才可进一步用概率密度表示。有限或可数状态空间上,概率质量函数则是相对于计数测度的密度。
对非负或可积可测函数
这就是“无意识统计学家法则”的一般形式:计算单变量函数的期望时,可以完全移到分布所在的取值空间。因而同分布变量对一切可积可测
反过来,仅比较均值、方差或有限多个矩通常不能确定分布;即使所有阶矩都存在,也需要额外条件才能保证矩唯一决定概率测度。分布收敛因此比较整族推前测度对连续有界测试函数的作用,“若干摘要接近”不足以充当定义。
统计模型把候选分布组织成
参考资料
- Patrick Billingsley, Probability and Measure, 3rd ed., Wiley, 1995, Chapters 1–2.
- Olav Kallenberg, Foundations of Modern Probability, 3rd ed., Springer, 2021, Chapter 1.
- Sheldon Ross, A First Course in Probability, 10th ed., Pearson, 2019, Chapter 4.