形式陈述
阅读顺序可以先看“两枚硬币”与质量函数,再回到测度定义。初学只需把有限表中非负、总和为一的权重算清;连续 CDF、混合分布和 Cantor 分布逐层说明这张表何时需要推广。
可测空间 上的概率分布,是总质量为 的测度公理库测度Measure在可测集合上取非负扩展实值、并对不交可数并保持可加性的函数。 。也就是说,、,并且对两两不交的可测集合 ,
记录结果落入 的概率。这里 是全部可能取值, 是允许询问的取值范围,而 是其中一个问题。例如掷骰子时, 问的是“结果是否为偶数”,并不是一次具体结果。分布必须同时回答所有这些可测问题,而且回答之间须满足可数可加性。对连续分布,单点概率不能通过不可数求和恢复区间概率;因此定义直接给整个可测范围赋质量。
若概率空间为 ,而 是可测映射,则 的分布或“律”定义为
可测性保证右边的逆像属于 ,因而可以计算概率。这称为把 沿 推前; 沿用函数公理库函数Function · Map · Mapping由定义域、陪域和单值图共同组成,并把每个输入送到唯一输出的映射。页的集合逆像记号,不要求 有逆函数。 作用在样本事件上, 作用在取值空间的可测集上,两个测度的定义域不可混用。[1,2]
分布也可以先于某个具体随机变量给出。事实上,在概率空间 上取恒等映射 ,它的律就是 。所以“一个分布”和“在某个随机试验中实现该分布的随机变量”是两个层次的对象。
直觉
随机试验可以包含许多细节,而分布只保留某个观察量的概率规律。独立地掷两枚公平硬币有四种等可能结果;若 只记录正面个数,则
HT 与 TH 被观察量合并成同一个数值。给定 的分布,可以回答关于正面个数的问题,却无法恢复两次抛掷的顺序。这种信息丢失不是计算失误,而是“只记录该变量的律”的定义结果。
两个变量同分布,只表示它们对所有可测结果范围给出相同概率,并不表示它们每次取相同值,更不表示它们独立。同分布比较的是各自的统计规律;同一个概率空间上的联合分布才记录二者如何一起变化。
例子与边界
质量函数、密度与 CDF
若存在有限或可数集合 ,满足 且每个 的单点集可测,则质量函数 满足 ,并且 。这是离散分布的表示方式;质量函数也可视为相对于计数测度的密度,区别于相对于长度测度的密度。
实数上的分布若相对于 Lebesgue 测度有密度 ,则
密度值不是单点概率,也可以大于 :在 上均匀分布的密度为 ,但任一单点的概率仍为零。概率由“高度与宽度一起积分”得到,而不是把高度直接解释为事件概率。
任意实数上的 Borel 概率分布都有累积分布函数
单调不减、右连续,并在两端趋于 与 ;它唯一确定分布,因为 ,这些区间足以确定 Borel 概率测度。
连续的 CDF 为什么还不够
对实数上的 Borel 概率分布,CDF 在 的跳跃量满足
因此“所有单点质量为零”和“CDF 连续”等价;在这个空间上,它们也等价于分布无原子。原子指正质量却无法拆成两块正质量部分的可测集。存在 Lebesgue 密度则更强:它要求 绝对连续,而不只是连续。
Cantor 分布说明差别。令 为独立公平比特,取 。它的值落在三进制只使用 的 Cantor 集上;任何具体值至多对应一条这样的数字序列,匹配前 位的概率为 ,故单点概率为零。另一方面,第 轮构造中剩余区间的总长度为 ,趋于零;Cantor 集因而长度为零,却承载全部概率,故该分布不可能具有 Lebesgue 密度。[1,2]
点质量与连续质量的混合
考虑 :四分之一质量放在 ,其余均匀铺在区间上。其分布函数公理库分布函数Cumulative distribution function · CDF实值分布在每个阈值左侧累积的概率,是非降右连续且端点极限为零和一的函数。是
例如 ,而 。只画高度 的密度线,会漏掉原点的四分之一质量;有限高度的普通密度无法给单点分配正概率。
相同边际,完全不同的联合行为
令 为独立公平比特。下面三对变量的每个坐标都服从 :
但二者相等的概率依次是 。各坐标的边际分布完全相同,联合行为却覆盖独立、完全一致、完全相反三种情况。给定边际再选择一个联合分布,就是选择一种耦合;边际信息本身没有规定该怎么耦合。
在无限集合上也不能随意使用“每个点等可能”。若可数无限离散空间中每个点都有相同质量 ,则 导致总质量无穷, 又导致总质量为零。连续均匀分布可以让所有单点概率为零,是因为其空间不可数,不能套用同一个可数求和论证。
“均匀”也需要指定参考结构。有限集可规范化计数测度,有限长度区间可规范化长度测度;全体整数或整条实线上不存在平移不变、总质量为 的概率测度。例如实线被 分割,平移不变会迫使它们全有同一质量,又陷入无穷等质量求和的矛盾。
推论与应用
对可测函数 ,只要 非负或 可积,推前关系给出
因此一个变量的期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。及其可积函数的期望,只依赖这个变量的律,不依赖它被哪个随机试验实现。若需要计算 ,则通常必须知道联合分布,不能只拿两个边际替代。
上述混合分布的均值为 ,不必把原子塞进普通密度。进一步变换 时,其分布是沿 对 再次推前。
CDF 与密度的关系还决定计算方式:已知 CDF 可以直接求区间概率;只有在绝对连续情形,才能把 CDF 几乎处处的导数作为完整密度。对于含跳跃或奇异部分的分布,只保留导数会丢失概率质量。
统计模型公理库统计模型与参数Statistical model · Statistical parameter对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。规定一族候选分布及其参数;观测数据生成的经验测度公理库经验测度Empirical measure · Empirical distribution把有限观测的重复频数编码为原子概率测度。则把每条观测记录对应的点质量乘以 后相加,重复观测的权重随之累加。给定非空观测记录,经验测度由这些记录确定;样本随机时,它才随样本成为随机对象。它与目标分布之间的逼近性质需要相应样本假设和概率定理。理论分布、一次有限样本以及由样本形成的估计,并不是同一个对象。
最后,均值、方差等少量摘要通常不能确定一个分布;即使给出全部矩,也仍需额外条件才能保证唯一性。选择摘要时,应先问要回答哪一类概率问题,而不是默认几个参数已保留完整规律。
在实线上比较两份分布时,一维单调输运公理库一维单调输运Monotone rearrangement transport · Quantile transport按累计质量的相同分位数配对,以消除交叉证明一维凸距离成本的最优性。将同一分位数的质量配对。凸位移成本下,消除交叉不会增加成本,因此分布函数和分位数不仅用于描述分布,也能直接计算最优搬运。
参考资料
- [1] Sheldon Axler, Measure, Integration & Real Analysis, Springer, 2020,作者电子版更新于 2026-06-12,Chapter 12,Definitions 12.27、12.32 及其相邻结果;概率律、CDF 与密度。
- [2] Rick Durrett, Probability: Theory and Examples,第 5 版作者稿,2019-01-11,§§1.2、1.6、2.1;分布表示、变量变换与独立性。
- [3] Patrick Billingsley, Probability and Measure, 3rd ed., Wiley, 1995,Chapter 2;分布函数及概率测度的构造。