形式陈述
设 T 对模型 { P θ : θ ∈ Θ } 充分 公理库 充分统计量 Sufficient statistic 以参数无关的条件分布保留整个模型区分能力的数据压缩,并连接因子分解与决策等价。 ,行动空间是实向量空间中的凸集,U = U ( X ) 是可积估计规则 公理库 估计量、决策规则与风险 Estimator and decision rule · Statistical risk 从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。 。取充分性的共同条件核 K ( t , d x ) ,可定义一个不含未知参数的条件期望 公理库 条件期望 Conditional expectation 给定子 σ-代数后可测、并在所有已知事件上保持原积分的随机变量。 版本
U ∗ ( t ) = ∫ U ( x ) K ( t , d x ) , U ∗ ( T ) = E θ [ U ∣ T ] P θ -a.s. for every θ . 若对每个 θ ,损失 a ↦ L ( θ , a ) 凸,且相关期望有限,则
R ( θ , U ∗ ) = E θ [ L ( θ , U ∗ ) ] ≤ E θ [ L ( θ , U ) ] = R ( θ , U ) . 证明只需在给定 T 后应用Jensen 不等式 公理库 Jensen 不等式 Jensen's inequality 凸函数作用于平均值不超过函数值的相同加权平均。 :
L ( θ , E [ U ∣ T ] ) ≤ E [ L ( θ , U ) ∣ T ] , 再取总期望。若损失在相关条件分布的凸包上严格凸,等号要求 U = U ∗ ( T ) 几乎处处;也就是原规则已经只依赖 T 。损失只有局部严格凸或条件分布退化时,等号条件应按实际凸区间细查。
平方损失下,条件期望的正交性给出精确分解
E θ [ ( U − g ( θ ) ) 2 ] = E θ [ ( U ∗ − g ( θ ) ) 2 ] + E θ [ Var θ ( U ∣ T ) ] . 其中最后一项也可写成 E θ [ ( U − U ∗ ) 2 ] 。风险减少量正是给定 T 后仍残留、且与参数推断无关的平均条件方差。
直觉
对固定参数 θ 和任意统计量 T ,条件期望作为 L 2 ( P θ ) 中投影,都会减少相对于常数目标的平方误差,并由塔式性质保持期望:
E θ [ U ∗ ] = E θ [ U ] . 关键障碍在“能否用同一函数服务所有参数”。若 T 不充分,E θ [ U ∣ T = t ] 的函数形式可能随未知 θ 改变,只能得到一族 oracle 投影。共同条件核把这些参数点上的投影粘合成单个可实施规则,这正是充分性在定理中的职责。
例子与边界
设生产线上独立抽检的缺陷指示 X i ∼ Bernoulli ( p ) ,目标是缺陷率 p 。只看第一件产品的 U = X 1 无偏但浪费了其余抽检;充分统计量为 S = ∑ i X i 。给定 S = s ,缺陷位置在 n 个坐标中均匀,因此
U ∗ ( S ) = E [ X 1 ∣ S ] = S n = X ¯ . 原规则的方差为 p ( 1 − p ) ,条件化后为
Var p ( S / n ) = p ( 1 − p ) n . 两者期望相同,后者方差缩为前者的 1 / n 。计算过程也很具体:固定总缺陷数后,第一位置的不确定性被平均成 s / n ,从只用一件产品自然恢复出全样本比例。
若 U 已经等于 S / n ,再次条件化保持不变,风险等号成立。条件期望因此具有投影的幂等性:落在 σ ( T ) -可测函数空间中的规则不会被重复改写。
边界与失败情形
定理比较的是 U ∗ 与起点 U ,没有直接遍历所有估计量。得到唯一 UMVU 还要把 T 的完备性和无偏比较类接进来;在允许偏差的 MSE 类中也可能存在另一条更优收缩规则。
损失非凸时 Jensen 的方向不再提供保证。0 –1 决策下,条件均值甚至可能不在离散行动空间中;合适做法是给定 T = t 后直接最小化条件风险,而不是机械输出均值。
条件期望需要一阶可积,平方风险分解还要二阶可积。重尾规则若方差无穷,凸损失版本可能仍对截断损失有意义,却不能把无穷方差形式写成有限的改进量。
充分统计量可能与完整样本同维,也可能计算昂贵。定理只比较统计风险,不承诺存储或算法成本下降。
全方差公式 公理库 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 从另一角度核对平方损失下降:
Var θ ( U ) = E θ { Var θ ( U ∣ T ) } + Var θ { E θ ( U ∣ T ) } . 若 U 有偏,条件化仍保持同一均值函数,因此偏差不变、方差减少;MSE 改善来自消除条件随机性,并非偏差—方差交换。
向量行动可在凸空间中使用条件 Jensen;若行动集合非凸或另带硬约束,条件均值可能不可行。此时应寻找基于 T 的条件风险最小行动,逐坐标平均不再是通用答案。
推论与应用
Rao–Blackwell 化可以沿更细到更粗的充分 σ -代数迭代;若再条件到一个不充分的粗函数,共同参数无关版本可能消失。最小充分统计量 公理库 最小充分统计量 Minimal sufficient statistic 能由任何其他充分统计量可测地恢复的充分统计量,代表样本中的最粗充分划分。 给出自然的最粗充分终点;若它还完备,Lehmann–Scheffé 定理 公理库 Lehmann–Scheffé 定理 Lehmann–Scheffé theorem 完备充分统计量上的二阶可积无偏函数,在全参数空间同时成为唯一最小方差无偏估计。 把“不劣于起点”提升为唯一 UMVU。
Monte Carlo 中也常对已知条件结构取期望以降方差。那里通常在一个固定模拟分布下工作,不需要跨未知参数粘合共同版本;数学投影相同,统计充分性的角色却不同。
更一般地,条件化保留整条期望函数 θ ↦ E θ U 。因此它不仅改进无偏估计,也能在保持原偏差曲线的同时降低凸风险;应用前仍须确认共同条件核、可积性和行动空间三项接口。
参考资料
Calyampudi R. Rao, “Information and the Accuracy Attainable in the Estimation of Statistical Parameters,” Bulletin of the Calcutta Mathematical Society 37, 1945。
David Blackwell, “Conditional Expectation and Unbiased Sequential Estimation,” Annals of Mathematical Statistics 18(1), 1947。
Erich L. Lehmann and George Casella, Theory of Point Estimation , 2nd ed., Springer, 1998,§1.7。