Skip to content

联合分布

Joint distribution · 联合概率分布

多个随机元素组成的向量所推出的概率测度,完整记录边缘与依赖结构。

条目类型
定义

形式陈述

随机元素

X:(Ω,F,P)(S,S),Y:(Ω,F,P)(T,T).

映射 (X,Y):ΩS×T 对乘积 σ-代数 ST 可测。它的推前概率分布

L(X,Y)(C)=P((X,Y)C),CST,

称为 X,Y 的联合分布。

边缘分布由坐标投影取回:

L(X)(A)=L(X,Y)(A×T),L(Y)(B)=L(X,Y)(S×B).

离散情形中,这对应把联合质量表按另一坐标求和;若联合分布有密度 fX,Y,Tonelli 定理给出

fX(x)=fX,Y(x,y)dy,fY(y)=fX,Y(x,y)dx

的几乎处处版本。

X,Y 独立当且仅当

L(X,Y)=L(X)L(Y),

其中右侧是乘积测度。在联合密度存在时,这等价于 fX,Y(x,y)=fX(x)fY(y) 几乎处处;没有联合密度时,仍必须回到测度或可测矩形上的乘积定义。

直觉

边缘分布像分别拍摄的两张单人照片,只说明每个坐标单独出现什么;联合分布是一张同框照片,保留哪些取值会一起出现。固定两份边缘后,仍可以用许多方式配对样本,这些联合测度称为边缘之间的耦合。独立乘积只是其中一个特别对称的选择。

从联合分布可以推出边缘,反方向却通常不行。求边缘是把另一坐标的信息积分掉,这个操作不可逆;依赖、相关、条件分布和事件同时发生的概率,都可能在边缘化时被丢失。

例子与边界

X 为公平 Bernoulli 变量。若取 Y=X,联合质量只落在 (0,0)(1,1),各为 1/2;若令 YX 独立,则四个点各为 1/4。两种模型的边缘完全相同,但前者满足 P(X=Y)=1,后者只有 1/2

再取 UU[0,1],令 (X,Y)=(U,U)。两个边缘都有普通密度,联合测度却全部集中在对角线

{(x,y):x=y}

上;这条线的二维 Lebesgue 测度为零,因此联合分布没有二维普通密度。不能从“每个坐标连续”推出“联合分布有密度”。

二维边缘也不足以确定更高维联合分布。令 X,Y 为独立公平比特,Z=XY;每一对都与两个独立公平比特同分布,但三元组满足确定约束 XYZ=0。所以知道所有一维甚至所有二维边缘,仍可能遗漏高阶依赖。

联合分布只规定取值怎样同现,不要求变量具有同一物理来源。耦合法常把原本定义在不同概率空间的两个分布放到一个新空间中共同实现,以便控制 P(XY)E[d(X,Y)]。选取哪种耦合会改变这些联合量,但不会改变给定边缘。

推论与应用

对联合可积的可测函数 g

E[g(X,Y)]=S×Tg(x,y)L(X,Y)(d(x,y)).

因此协方差、和的分布、最大值概率与损失风险都需要联合分布,而不能由两个边缘单独计算。只有当 g(x,y) 可分离且变量独立时,积分才相应因子化。

条件分布把一个坐标固定为信息后,描述另一个坐标的剩余规律;条件期望则对这种剩余规律取平均。二者都以联合结构为输入:同样的边缘配上不同耦合,会产生不同条件规律。

Markov 链用相邻时刻联合分布和转移核组织时间依赖,信息论用联合分布与边缘乘积之差定义互信息,最优传输则在固定边缘的全部耦合中最小化运输成本。三类应用关心的对象不同,却都依赖“边缘之外的同现结构”。

参考资料
  • Olav Kallenberg, Foundations of Modern Probability, 3rd ed., Springer, 2021, Chapters 1 and 4.
  • Rick Durrett, Probability: Theory and Examples, 5th ed., Cambridge University Press, 2019, Chapter 1.
  • MIT OpenCourseWare, 6.436J Fundamentals of Probability: Lecture Notes, lectures on random vectors and joint laws.
关系图谱40 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系

被这些条目使用