Skip to content

定义Definition

期望

Expectation · Expected value

实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。

形式陈述 ​

初读可先用有限分布的 ∑xxp(x) 理解加权平均,再用本节的可积性条件判断何时能推广到无限情形。下文统一区分总体期望、随机样本平均与给定信息后的条件期望。

随机变量 X 的期望,是它相对于概率测度的 Lebesgue 积分。若 X≥0,定义

EX=∫ΩXdP∈[0,∞].

非负变量的期望总有定义,但可以是 +∞。一般实变量要先拆成 X=X+−X−,其中 X+=max(X,0)、X−=max(−X,0)。只有 EX+、EX− 不同时为无穷大时,才定义扩展期望

EX=EX+−EX−.

若 E|X|<∞,则称 X 可积,期望是有限实数。可积性排除了用正负两端的无穷量“互相抵消”。复随机变量的有限期望分别对实部和虚部积分,通常同样要求 E|X|<∞。[1,2]

对实随机变量 X,设其分布为 μ,同一个期望还可写成

EX=∫Rxμ(dx).

离散时化为 ∑xxP(X=x);有密度 f 时化为 ∫Rxf(x)dx。求和与密度积分是分布的特殊表示,不是两种彼此无关的期望定义。

直觉

期望是按概率质量加权的平均位置。公平骰子的平均点数为 3.5,尽管骰子从不掷出 3.5;它也不是“最有可能出现的值”,因为六个点数具有相同概率。若以概率 0.99 得到 0、以概率 0.01 得到 100,期望为 1,最常出现的结果却是 0。期望概括长期平均的中心位置,不替代单次结果或完整分布。

“大量重复后的平均”提供直觉,但不是期望定义所需的前提。先有随机变量与概率测度,才能定义积分;在独立同分布且可积等条件下,大数定律再说明样本平均趋向期望。若直接拿重复试验来定义期望,就会把需要证明的收敛结论藏进定义。

把一个复杂总量拆成很多简单贡献,往往比先求它的完整分布更有效。设总量在每个样本点上都满足 T(ω)=X(ω)+Y(ω);只要两项可积,积分便把逐点加法变成 ET=EX+EY。这里并没有把联合概率拆成乘积,所以不需要独立。读一道期望题时,应先找这种逐点成立的分解,再检查每一项能否积分;只有计算乘积期望等步骤时,才另行询问依赖关系。

例子与边界

指示变量把概率变成代数 ​

事件 A 的指示变量只取 0,1,因此 E1A=P(A)。若 N=∑i=1m1Ai 统计发生次数,则

EN=∑i=1mP(Ai).

事件之间可以高度相关。例如把 n≥1 封信按均匀随机排列装入 n 个信封,令 Ii 表示第 i 封信放对。每封信放对的概率为 1/n,所以放对总数的期望是 ∑i1/n=1。各事件一般并不独立:前面放置的信息会改变后面的选择,但线性性不需要它们独立。

对于可积 X,Y 和常数 a,b,一般形式为 E(aX+bY)=aEX+bEY。若涉及无穷期望,应回到正负部分检查表达式,而不能自动相减。

尾概率也能累计成期望 ​

非负整数值变量 N 满足逐点恒等式

N=∑k=1∞1{N≥k}.

一个值为 7 的结果,恰好越过 1 到 7 这七层门槛。非负性允许用Tonelli 定理交换积分与求和,于是

EN=∑k=1∞P(N≥k).

若 N 为独立 Bernoulli 试验中首次成功的次数,成功概率 p>0,则 P(N≥k)=(1−p)k−1,从几何级数立即得到 EN=1/p。若改数“成功前的失败次数”,随机变量变为 N−1,期望相应为 (1−p)/p。

对一般非负实变量,层的高度连续变化,得到

EX=∫0∞P(X>t)dt.

这个尾积分公式使“均值是否有限”直接成为尾概率衰减速度的问题,并不要求变量有密度。

对称分布不一定有期望 ​

标准 Cauchy 变量的密度为 f(x)=1/[π(1+x2)]。对每个 M,对称截断积分 ∫−MMxf(x)dx=0;但正半轴与负半轴上的绝对贡献各自发散:

∫0Mxπ(1+x2)dx=log⁡(1+M2)2π⟶∞.

因此它的正、负部分期望都为无穷,EX 不存在。对称截断的值称为一种主值,不能冒充期望。这个例子划清了“分布关于零对称”和“具有均值零”的边界。

固定 c>0,采用不对称截断,便有

∫−RcRxπ(1+x2)dx=12πlog⁡1+c2R21+R2⟶log⁡cπ.

换一个 c 就换一个极限。对称主值只是某种截断规则的结果,不是一个与截断无关的概率平均。

收敛为什么不能自动穿过期望 ​

在 (0,1) 上均匀取 U,令 Xn=n1{U<1/n}。对每个固定 U>0,足够大的 n 都使 Xn=0,所以 Xn→0 几乎必然;但

EXn=n⋅1n=1.

非零部分越来越罕见,同时越来越高,面积始终没有消失。几乎必然收敛控制每条样本路径的尾部,却不自动控制随 n 移动的稀有大值。

推论与应用

积分运算的正确条件 ​

若 0≤Xn↑X,单调收敛定理保证 EXn↑EX,允许极限为无穷。若 Xn→X 几乎必然,且存在同一个可积变量 Y 满足 |Xn|≤Y,则支配收敛定理保证期望收敛。这些条件分别利用单调性或统一的尾部控制,补上上面尖峰例子缺少的约束。

有限个可积变量可以直接使用线性性;非负可数项可以通过单调收敛交换求和与期望;一般有正有负的可数项,需要绝对可积等额外条件;例如 ∑nE|Xn|<∞ 就足以交换求和与期望。把“有限求和能做”推成“任何无穷求和都能做”,是最容易隐藏错误的跨步。

若 X,Y 独立且分别可积,则 XY 也可积,并有 E(XY)=EXEY;没有独立性时一般不成立。例如 Y=X 时,左边是二阶矩,而非均值平方。乘积公式与线性公式所需的假设不同。有限均值也不保证有限二阶矩:密度 p(x)=32x−5/21[1,∞)(x) 给出 EX=3,却有 EX2=∞。

变换变量而不重求分布 ​

对可测 g,只要 g≥0 或 g(X) 可积,就有

E[g(X)]=∫g(x)PX(dx).

例如公平骰子 D 的平方期望直接为 (12+⋯+62)/6=91/6,不必先给 D2 建一张新分布表。它与 (ED)2=49/4 不同,差为 35/12,正是方差。按本库方差条目的约定,使用有限二阶矩来保证这些式子都是有限量。

对非负 X 和 t>0,逐点不等式 t1{X≥t}≤X 给出 Markov 不等式。对凸函数 φ,在 X 与 φ(X) 可积时,Jensen 不等式给出 φ(EX)≤Eφ(X)。两者都把积分的顺序性质转成可用的概率或非线性界。

从总体平均到给定信息后的平均 ​

EX 是指定模型下的确定数值;X―n=n−1∑iXi 是随样本变化的随机变量。IID 且可积时,强大数律保证 X―n→EX 几乎必然;进一步有有限方差时,Var(X―n)=Var(X)/n。收敛、有限样本误差和无偏性是三个不同结论,不能用“平均会接近期望”一句话互相替代。

可积变量的条件期望 E[X∣G] 是只利用信息 G 表达的随机变量,而通常不是一个常数;再次取总体平均,仍有

E[E[X∣G]]=EX.

在有限分组的情形,这就是先算各组均值,再按组概率加权。它把一次复杂平均拆成条件内与条件外两层,而不是随意交换随机条件。

一阶矩方法利用非负坏事件计数的期望证明好对象存在;Monte Carlo 则用样本均值近似积分。前者关心平均值怎样约束存在性,后者还要研究随机误差如何随样本数变化。期望提供中心量,置信范围仍须由方差、尾界或其他概率工具补足。

对人数路径积分可换成逐位顾客的逗留时间之和,Little 定律据此连接平均人数、有效到达率与平均时间。若继续追踪当前服务的剩余工作量,M/G/1 平均等待公式还会引入服务时间二阶矩;有限平均服务并不自动保证有限平均等待。

参考资料
  • [1] Rick Durrett, Probability: Theory and Examples,第 5 版作者稿,2019-01-11,§1.6“Expected Value”,尤其 §§1.6.2–1.6.3;极限交换、尾积分与期望计算。
  • [2] Sheldon Axler, Measure, Integration & Real Analysis, Springer, 2020,作者电子版更新于 2026-06-12,Chapter 3、Chapter 12;非负积分、积分收敛定理与概率期望。
  • [3] Joseph K. Blitzstein and Jessica Hwang, Introduction to Probability, 2nd ed., CRC Press, 2019,Chapter 4;线性性、指示变量与随机变量函数的期望。
关系图谱232 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系