Skip to content

定义Definition

条件期望

Conditional expectation

以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。

条件期望回答一个预测问题:只允许利用已经掌握的信息,对随机量 X 应怎样给出平均预测?信息越粗,我们就把越多可能结果合并求平均;信息越细,预测就能随观察结果作出更多区分。

因此 E[X∣G] 一般是随机变量,而不是一个数。G 表示允许使用的信息;条件期望给每种可辨认的情况分配一个预测值。普通期望是完全不区分情况时的特例。[1][2]

形式陈述 ​

一般定义:可见性与积分守恒 ​

设实值随机变量 X 绝对可积,即 E|X|<∞,G⊆F 是一个子 σ-代数。实值随机变量 Y 称为 X 关于 G 的条件期望,如果

Y 可积且为 G-可测,∫AYdP=∫AXdP对每个 A∈G.

第一条让预测只随可辨认的信息变化。下文的四结果例子中,Y 必须在 A 内取相同值,在 B 内也取相同值。第二条再决定各组该取多少:若在正概率组 A 上恒取 c,就必须有 cP(A)=E[X1A],因而 c 等于组内的条件加权平均。仅要求 E[Y]=E[X] 只能固定所有组加起来的总量,仍允许把一组的预测人为调高、另一组调低;逐个可见事件的积分等式排除了这种错误补偿。

满足条件的 Y 存在,并且在几乎处处意义下唯一。存在性可由 Radon–Nikodym 定理得到:对非负可积 X,在 G 上定义测度 ν(A)=∫AXdP,它关于 P 绝对连续,其密度就是所求 Y;一般 X 再分解成正部与负部。

唯一性的理由也直接体现了定义。若 Y,Z 都满足条件,事件 A={Y>Z} 属于 G,而

∫A(Y−Z)dP=0.

非负函数积分为零意味着它几乎处处为零,因此 P(Y>Z)=0;交换二者可得 Y=Z 几乎处处。“条件期望”通常指这一等价类,具体选出的随机变量称为一个版本。

复值可积变量 X=U+iV 的条件期望按实部与虚部分别定义为 E[U∣G]+iE[V∣G];事件积分等式与唯一性逐分量成立。下文涉及大小关系、正负部分、平方误差和实凸函数的结论均采用实值变量。

两个端点有助于定位概念:G={∅,Ω} 时,条件期望是常数 E[X];X 已经 G-可测时,E[X∣G]=X 几乎处处。后一种情形中,答案本身已经包含在允许使用的信息里。

同组对象获得相同预测,但平均按原概率加权。A 组的条件均值是 2/3,而不是两个取值的算术平均 1。

非负变量允许无穷期望 ​

若 X:Ω→[0,∞] 可测,仍可定义扩展值条件期望。令 Xn=X∧n,先按可积情形取 Yn=E[Xn∣G]。保序性给出 0≤Yn≤Yn+1 几乎处处;把这些可数例外并入同一个 G-可测零测集,并在其上把所有 Yn 置零,就可选到处处单调的版本。定义

E[X∣G]=limn→∞Yn∈[0,∞].

它为 G-可测,而且对每个 A∈G,在等式两边使用单调收敛定理得到

∫AlimnYndP=limn∫AYndP=limn∫A(X∧n)dP=∫AXdP.

两边可以同时为无穷。这个非负版本仍唯一到几乎处处相等:若 Y,Z 都满足事件积分等式,先限制到 {Y≤k, Z≥Y+1/j},其中 k,j≥1 为整数。该集合上 Y 的积分有限,等式便迫使集合概率为零;对 k,j 取可数并,再交换 Y,Z 即得唯一性。可积 X 时此定义与前文相同。它不允许把正负两部分的无穷条件期望直接相减。

给定一个变量,和给定它的一个数值 ​

记号

E[X∣Z]:=E[X∣σ(Z)]

表示只根据 Z 预测 X。对实值 Z,可以把一个版本写成 g(Z)。其中 g 是预测规则,g(Z) 是随观察结果变化的随机变量,g(z) 才是观察到具体 z 后采用的数值。

若 Z 离散且 P(Z=z)>0,公式是熟悉的条件加权平均:

g(z)=E[X1{Z=z}]P(Z=z).

连续分布的 Z 在每个单点上满足 P(Z=z)=0。有联合密度时,可用条件密度积分求 g(z);更一般的构造见正则条件概率。预测规则 g 在 Z 的分布意义下几乎处处确定:在一个 PZ-零测集上改变它的值,仍给出同一个条件期望版本等价类。

例如 U,V 独立且均匀分布于 [0,1]。给定 S=U+V 后,U,V 的角色对称,又有二者之和等于 S,于是

E[U∣S]=E[V∣S]=S/2.

因此观察到总和后,两项的平均预测各占一半;推导使用的是对称性与线性,而无需先求出条件密度。

直觉

从四个结果看清“按信息分组” ​

设样本空间有四个结果,概率与 X 的值如下。观察者无法区分前两个结果,也无法区分后两个结果,只知道自己落在哪一组。

结果 ω1 ω2 ω3 ω4
概率 1/2 1/4 1/8 1/8
X 0 2 4 8
可见组别 A A B B

落在 A 时,需要把组内概率重新归一化:两种结果的条件概率为 2/3,1/3,所以预测是 2/3;落在 B 时,预测是 6。于是

E[X∣G]=231A+61B,G={∅,A,B,Ω}.

A 组中的零值结果出现概率是另一结果的两倍,所以加权平均为 2/3;算术平均 1 则对应两种结果等可能的另一种模型。

这两个预测还保留了每组的总量。例如

E[X1A]=12=E[231A].

对全部结果再取平均,也得到

E[E[X∣G]]=34⋅23+14⋅6=2=E[X].

一般定义要保留的,正是“只按已知信息变化”和“每个可见事件上的总量不变”这两件事。

补充示意图
分块平均与平方误差投影
例子与边界

掷骰子的完整计算:信息解释了哪部分波动 ​

独立掷两枚公平六面骰,点数为 D1,D2,总和为 S=D1+D2。未观察任何骰子时,预测为 E[S]=7;看到第一枚后,

E[S∣D1]=D1+E[D2]=D1+72.

实际残差为 D2−7/2,所以剩余均方误差是 35/12。而原先用常数 7 预测的误差为

Var(S)=356.

信息把误差分成了两半:由第一枚骰子解释的波动,以及尚未观察的第二枚骰子留下的波动。一般地,对平方可积的 X,

Var(X)=E[Var(X∣G)]+Var(E[X∣G]).

其中

Var(X∣G)=E[(X−E[X∣G])2∣G]

本身也是随机变量。第一项是平均剩余不确定性,第二项是不同可见情况之间的预测差异。

信息嵌套与独立性 ​

塔式法则需要信息集合嵌套。取独立公平比特 A,B,令 H=σ(A)、G=σ(A⊕B)。由于 A 与 A⊕B 独立,

E[E[A∣G]∣H]=12,E[A∣H]=A.

观察 A⊕B 会把关于 A 的预测平均成常数;随后再按 A 分组,这个常数保持不变。信息集合嵌套时,塔式法则才给出下面所述的简化。

另一个边界是独立性。X 与 G 独立且可积,确实推出 E[X∣G]=E[X];反方向对单个 X 不成立。令 X∼Unif[−1,1],G=σ(X2),就有 E[X∣G]=0,但 G 显然包含关于 |X| 的信息。若要刻画完整独立性,应对所有有界可测变换 g(X) 都要求条件期望保持不变。

推论与应用

平方误差下,条件期望是正交投影 ​

进一步假设 E[X2]<∞。所有平方可积且 G-可测的随机变量组成 L2 的一个闭子空间。设 Y=E[X∣G],则对该子空间中的任意 Z,

E[(X−Y)Z]=0.

它先由定义对指标函数成立,再推广到简单函数、有界函数,最后经截断与 L2 极限扩展到任意这样的 Z。也就是说,预测残差 X−Y 与每个可用信息构成的平方可积统计量都正交。

因而任何另一个允许的预测 W 都满足

E[(X−W)2]=E[(X−Y+Y−W)2]=E[(X−Y)2]+E[(Y−W)2].

交叉项为零,这就是概率空间中的勾股定理。第二项非负,所以 Y 是唯一到几乎处处相等的最小均方误差预测。这一结论是 正交投影在随机变量空间中的具体实例。[2]

可积性 X∈L1 支持积分定义;平方可积性 X∈L2 进一步支持残差正交和均方误差最小化。损失函数改变时,最优预测也随之改变:平方损失对应条件均值,绝对值损失对应条件中位数。

从定义推导常用运算 ​

线性与保序。对可积 X1,X2 和常数 a,b,条件期望保留线性组合;若 X1≤X2 几乎处处,则相应条件期望也保持大小关系。因此可以先拆分随机量,再分别计算预测。

提出已知因子。若 Z 为有界的 G-可测变量,则

E[ZX∣G]=ZE[X∣G].

在给定信息下,Z 的值已经确定,因此可以提出。无界 Z 的情形也适用,只要 X 与 ZX 均可积;对 |Z| 逐级截断可得 E[|Z|E[|X|∣G]]=E|ZX|<∞,再由 |ZE[X∣G]|≤|Z|E[|X|∣G] 得到右侧的可积性。

塔式法则。若 H⊆G,则

E[E[X∣G]∣H]=E[X∣H].

先用细信息预测,再忘掉部分信息,与直接使用粗信息一致。反向嵌套也有

E[E[X∣H]∣G]=E[X∣H],

因为内层结果已经由粗信息决定,自然也能由细信息观察到。

条件 Jensen 不等式。若 ϕ 为凸函数,X 与 ϕ(X) 可积,则

ϕ(E[X∣G])≤E[ϕ(X)∣G]几乎处处.

取 ϕ(x)=|x| 可得 L1 收缩;取 ϕ(x)=x2 可得平方可积情形的 L2 收缩。这些性质并非一组无关公式,它们都表达了同一件事:分组平均保留线性结构,却会平滑凸函数所衡量的波动。[1]

条件期望怎样进入统计与随机过程 ​

对平方可积估计量 T,取 E[T∣G] 保留其无条件期望,并使方差不增。Rao–Blackwell 方法选用充分统计量作为信息:给定它后的样本条件分布不依赖未知参数,于是条件平均可写成一条可实施的估计规则。

若信息随时间增长,Fs⊆Ft,那么对固定可积的最终量 X,过程 Mt=E[X∣Ft] 满足

E[Mt∣Fs]=Ms(s≤t).

这就是塔式法则产生的鞅:每次得到新信息都更新预测,而站在过去的视角,未来更新的平均值仍等于当前预测。条件期望因而把分组平均、最优预测与动态信息更新连成了同一套语言。

参考资料

[1] Rick Durrett, Probability: Theory and Examples, 5th ed., Cambridge University Press, 2019,Conditional Expectation 相关章节。作者公开稿。

[2] Steven P. Lalley, Conditional Expectation,University of Chicago 课程讲义。公开讲义,从条件期望的定义发展到 L2 投影与基本性质。

[3] David Williams, Probability with Martingales, Cambridge University Press, 1991,条件期望与鞅章节。适合进一步学习信息流、塔式法则和随机过程中的使用方法。

关系图谱81 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系