Skip to content

充分统计量

Sufficient statistic

给定该统计量后,样本剩余条件分布不再依赖未知参数的数据压缩。

形式陈述

设样本 X 的分布属于模型 {Pθ:θΘ}T=T(X)统计量。若存在一个不随 θ 改变的概率核 K(t,A),使对每个 θΘ、每个可测集 A

Pθ(XAT)=K(T,A)Pθ-几乎处处,

则称 T 对模型参数 θ 充分。换言之,一旦知道 T,原始样本中尚未由 T 决定的随机性不再携带区分不同 Pθ 的信息。

在标准 Borel 空间中可用正则条件分布表述上述定义。条件分布只在 PθT-几乎处处意义下唯一,不应要求在所有零概率取值 t 上逐点一致;严谨版本要求选取一个对所有参数通用的核,或使用等价的 σ-代数定义。

若模型被共同测度 μ 支配,且密度为 pθ(x),Fisher–Neyman 因子分解定理给出实用判据:T 充分当且仅当存在非负可测函数 gθh,使

pθ(x)=gθ(T(x))h(x)

对每个 θ 均在 μ-几乎处处成立。h 不含参数,数据对参数的全部似然依赖只通过 T(x) 进入。

直觉

充分性不是说压缩后能恢复原数据,而是说被丢掉的细节在条件于压缩结果后具有参数无关的分布。它是一项相对于整个模型族的性质;同一统计量对一个小模型可能充分,对更大的模型则可能不充分。

完整样本 T(X)=X 总是充分,却没有压缩价值。真正有用的充分统计量把样本维数降下来,同时保留模型用于区分参数的全部信息。维数小本身既非必要也非充分。

例子与计算

X1,,Xn 独立服从 Poisson(λ)λ>0。联合质量函数为

pλ(x1,,xn)=enλλixii=1n1xi!.

T=iXi,可写成

gλ(T)=enλλT,h(x)=i(xi!)1,

所以 T 充分。更具体地,在 T=t 条件下,

(X1,,Xn)midT=tMultinomial(t;1n,,1n),

该条件分布与 λ 无关。压缩丢掉了 t 个事件在各观测间如何分配的细节,但这些细节不再帮助推断共同强度。

对 Bernoulli 样本,成功次数 S=iXi 同理充分。给定 S=s 后,所有含 s 个一的二进制样本序列等概率,条件概率均为 1/(ns),不含成功概率 θ

边界与失败情形

样本均值并非对任意模型都充分。对 XiUnif(0,θ),似然为

θn1{maxiXiθ},

参数依赖通过样本最大值进入;两个样本可有相同均值却有不同最大值,从而对某些 θ 一个似然为零、另一个非零。因此均值不是充分统计量,最大值才是。

无偏、低方差与充分是不同属性。充分统计量可以有偏,甚至没有被指定为估计量;一个无偏估计量也可能丢失参数信息。Rao–Blackwell 改进需要把已有估计量条件化到充分统计量上,不能倒过来把任何低方差统计量叫作充分。

因子分解定理需要共同支配模型。无支配模型仍可用条件分布或似然比的 σ(T)-可测性刻画,不能因为找不到统一密度就断言没有充分统计量。

最小充分性比充分性更强:它要求任何其他充分统计量都能决定该统计量(几乎处处)。某个统计量充分并不自动最小,更不自动完备。

推论与应用

T 充分,基于完整样本的任何随机化决策都可通过先观察 T,再按参数无关的 K(T,) 重建剩余随机性来复制其风险。这是“没有丢失关于参数的决策信息”的精确含义。

在指数族中,样本通常通过固定维数的自然统计量进入联合密度,因而产生充分统计量。Rao–Blackwell 定理把估计量对 T 取条件期望,在凸损失下不增加风险;Lehmann–Scheffé 定理还需完备性,才能给出唯一最小方差无偏估计。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§6.2。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1。
  • David Blackwell and M. A. Girshick, Theory of Games and Statistical Decisions, Dover, 1979,关于 sufficient experiments 的章节。