Skip to content

定义Definition

概率分布

Probability distribution · Law

可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。

形式陈述 ​

阅读顺序可以先看“两枚硬币”与质量函数,再回到测度定义。初学只需把有限表中非负、总和为一的权重算清;连续 CDF、混合分布和 Cantor 分布逐层说明这张表何时需要推广。

可测空间 (S,S) 上的概率分布,是总质量为 1 的测度 ν。也就是说,ν(∅)=0、ν(S)=1,并且对两两不交的可测集合 B1,B2,…,

ν(⋃iBi)=∑iν(Bi).

ν(B) 记录结果落入 B 的概率。这里 S 是全部可能取值,S 是允许询问的取值范围,而 B∈S 是其中一个问题。例如掷骰子时,B={2,4,6} 问的是“结果是否为偶数”,并不是一次具体结果。分布必须同时回答所有这些可测问题,而且回答之间须满足可数可加性。对连续分布,单点概率不能通过不可数求和恢复区间概率;因此定义直接给整个可测范围赋质量。

若概率空间为 (Ω,F,P),而 X:Ω→S 是可测映射,则 X 的分布或“律”定义为

L(X)=PX,PX(B)=P(X∈B)=P(X−1[B]).

可测性保证右边的逆像属于 F,因而可以计算概率。这称为把 P 沿 X 推前;X−1[B] 沿用函数页的集合逆像记号,不要求 X 有逆函数。P 作用在样本事件上,PX 作用在取值空间的可测集上,两个测度的定义域不可混用。[1,2]

分布也可以先于某个具体随机变量给出。事实上,在概率空间 (S,S,ν) 上取恒等映射 X(s)=s,它的律就是 ν。所以“一个分布”和“在某个随机试验中实现该分布的随机变量”是两个层次的对象。

直觉

随机试验可以包含许多细节,而分布只保留某个观察量的概率规律。独立地掷两枚公平硬币有四种等可能结果;若 X 只记录正面个数,则

PX({0})=14,PX({1})=12,PX({2})=14.

HT 与 TH 被观察量合并成同一个数值。给定 X 的分布,可以回答关于正面个数的问题,却无法恢复两次抛掷的顺序。这种信息丢失不是计算失误,而是“只记录该变量的律”的定义结果。

两个变量同分布,只表示它们对所有可测结果范围给出相同概率,并不表示它们每次取相同值,更不表示它们独立。同分布比较的是各自的统计规律;同一个概率空间上的联合分布才记录二者如何一起变化。

例子与边界

质量函数、密度与 CDF ​

若存在有限或可数集合 S0⊆S,满足 ν(S0)=1 且每个 s∈S0 的单点集可测,则质量函数 p(s)=ν({s}) 满足 ∑s∈S0p(s)=1,并且 ν(B)=∑s∈B∩S0p(s)。这是离散分布的表示方式;质量函数也可视为相对于计数测度的密度,区别于相对于长度测度的密度。

实数上的分布若相对于 Lebesgue 测度有密度 f,则

ν(B)=∫Bf(x)dx,f≥0,∫Rf(x)dx=1.

密度值不是单点概率,也可以大于 1:在 [0,1/2] 上均匀分布的密度为 2,但任一单点的概率仍为零。概率由“高度与宽度一起积分”得到,而不是把高度直接解释为事件概率。

任意实数上的 Borel 概率分布都有累积分布函数

F(t)=ν((−∞,t]).

F 单调不减、右连续,并在两端趋于 0 与 1;它唯一确定分布,因为 ν((a,b])=F(b)−F(a),这些区间足以确定 Borel 概率测度。

连续的 CDF 为什么还不够 ​

对实数上的 Borel 概率分布,CDF 在 t 的跳跃量满足

F(t)−F(t−)=ν({t}).

因此“所有单点质量为零”和“CDF 连续”等价;在这个空间上,它们也等价于分布无原子。原子指正质量却无法拆成两块正质量部分的可测集。存在 Lebesgue 密度则更强:它要求 F 绝对连续,而不只是连续。

Cantor 分布说明差别。令 Bk 为独立公平比特,取 X=∑k≥12Bk/3k。它的值落在三进制只使用 0,2 的 Cantor 集上;任何具体值至多对应一条这样的数字序列,匹配前 n 位的概率为 2−n,故单点概率为零。另一方面,第 n 轮构造中剩余区间的总长度为 (2/3)n,趋于零;Cantor 集因而长度为零,却承载全部概率,故该分布不可能具有 Lebesgue 密度。[1,2]

点质量与连续质量的混合 ​

考虑 ν=14δ0+34Unif[0,1]:四分之一质量放在 0,其余均匀铺在区间上。其分布函数是

F(x)=ν((−∞,x])={0,x<0,14+34x,0≤x<1,1,x≥1.

例如 ν({0})=1/4,而 ν((0,1/2])=3/8。只画高度 3/4 的密度线,会漏掉原点的四分之一质量;有限高度的普通密度无法给单点分配正概率。

相同边际,完全不同的联合行为 ​

令 U,V 为独立公平比特。下面三对变量的每个坐标都服从 Bernoulli(1/2):

(U,V),(U,U),(U,1−U).

但二者相等的概率依次是 1/2,1,0。各坐标的边际分布完全相同,联合行为却覆盖独立、完全一致、完全相反三种情况。给定边际再选择一个联合分布,就是选择一种耦合;边际信息本身没有规定该怎么耦合。

在无限集合上也不能随意使用“每个点等可能”。若可数无限离散空间中每个点都有相同质量 c,则 c>0 导致总质量无穷,c=0 又导致总质量为零。连续均匀分布可以让所有单点概率为零,是因为其空间不可数,不能套用同一个可数求和论证。

“均匀”也需要指定参考结构。有限集可规范化计数测度,有限长度区间可规范化长度测度;全体整数或整条实线上不存在平移不变、总质量为 1 的概率测度。例如实线被 [n,n+1) 分割,平移不变会迫使它们全有同一质量,又陷入无穷等质量求和的矛盾。

推论与应用

对可测函数 g,只要 g 非负或 g(X) 可积,推前关系给出

E[g(X)]=∫Sg(s)PX(ds).

因此一个变量的期望及其可积函数的期望,只依赖这个变量的律,不依赖它被哪个随机试验实现。若需要计算 E[g(X,Y)],则通常必须知道联合分布,不能只拿两个边际替代。

上述混合分布的均值为 14⋅0+34∫01xdx=3/8,不必把原子塞进普通密度。进一步变换 Y=g(X) 时,其分布是沿 g 对 PX 再次推前。

CDF 与密度的关系还决定计算方式:已知 CDF 可以直接求区间概率;只有在绝对连续情形,才能把 CDF 几乎处处的导数作为完整密度。对于含跳跃或奇异部分的分布,只保留导数会丢失概率质量。

统计模型规定一族候选分布及其参数;观测数据生成的经验测度则把每条观测记录对应的点质量乘以 1/n 后相加,重复观测的权重随之累加。给定非空观测记录,经验测度由这些记录确定;样本随机时,它才随样本成为随机对象。它与目标分布之间的逼近性质需要相应样本假设和概率定理。理论分布、一次有限样本以及由样本形成的估计,并不是同一个对象。

最后,均值、方差等少量摘要通常不能确定一个分布;即使给出全部矩,也仍需额外条件才能保证唯一性。选择摘要时,应先问要回答哪一类概率问题,而不是默认几个参数已保留完整规律。

在实线上比较两份分布时,一维单调输运将同一分位数的质量配对。凸位移成本下,消除交叉不会增加成本,因此分布函数和分位数不仅用于描述分布,也能直接计算最优搬运。

参考资料
  • [1] Sheldon Axler, Measure, Integration & Real Analysis, Springer, 2020,作者电子版更新于 2026-06-12,Chapter 12,Definitions 12.27、12.32 及其相邻结果;概率律、CDF 与密度。
  • [2] Rick Durrett, Probability: Theory and Examples,第 5 版作者稿,2019-01-11,§§1.2、1.6、2.1;分布表示、变量变换与独立性。
  • [3] Patrick Billingsley, Probability and Measure, 3rd ed., Wiley, 1995,Chapter 2;分布函数及概率测度的构造。
关系图谱315 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置
类型化关系

被这些条目使用