形式陈述
在统计模型 公理库 统计模型与参数 Statistical model · Statistical parameter 对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。 { P θ ( n ) : θ ∈ Θ } 中,随机样本 X ( n ) 取值于可测空间 ( X n , A n ) 。统计量是一个在抽样前已经确定的可测映射
T n : ( X n , A n ) → ( T n , B n ) , 其计算规则不能使用未知的 θ 。随机元素 公理库 随机变量 Random variable · Random element 从概率空间到可测取值空间的可测映射;实值情形承载数值概率运算。 T n ( X ( n ) ) 在 P θ ( n ) 下的推前分布
Q θ , n = L θ , n ( T n ) = P θ ( n ) ∘ T n − 1 , 称为 T n 的抽样分布;具体地,Q θ , n ( B ) = P θ ( n ) { T n ( X ( n ) ) ∈ B } 。规则 T n 不含未知参数,抽样分布却通常同时随 θ 、n 与抽样设计改变。若数据是IID 样本 公理库 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,才可把 P θ ( n ) 专门写成 P θ ⊗ n 。
统计量可以是标量、向量、函数、集合或概率测度。样本均值、次序统计量、经验分布和完整样本本身都符合定义。一个统计量只有在被指定去估计某个目标时才成为估计量;同一 T n 也可能用于检验、模型诊断或构造区间,定义本身不评价优劣。
直觉
统计量是固定的数据处理规则,抽样分布则把这个规则放回一遍遍重复的同一实验中,记录输出如何波动。现实中只看到一次实现 t obs = T n ( x ) ;整条分布来自“模型 + 参数 + 设计 + 规则”,是标准误、置信覆盖与检验阈值的校准对象。
可以沿一次数据流区分四个对象:随机样本 X ( n ) 、已观察数值 x 、固定映射 T n 、以及输出随机量的律 Q θ , n 。样本直方图或经验分布是从这份 x 算出的统计量;它们本身不等于在重复采样中形成的抽样分布。
例子与边界
若一台测量仪的独立重复读数满足 X i ∼ N ( μ , σ 2 ) ,统计量
X ¯ = 1 n ∑ i = 1 n X i 满足精确抽样分布
X ¯ ∼ N ( μ , σ 2 n ) . X ¯ 的计算公式没有未知参数;它的中心和尺度却含 ( μ , σ ) 。表达式 ( X ¯ − μ ) / ( σ / n ) 是用来研究分布或反演区间的参数化随机量,若 μ , σ 未知,就不是一份数据单独能够计算的统计量;把 σ 换成样本标准差后才得到另一统计量,其分布也随之改变。
二元临床结局的 Bernoulli 样本中,S = ∑ i X i 是总成功数,且
S ∼ Binomial ( n , θ ) . 观测到 S = s 只是这条二项分布的一次实现;抽样分布仍是对 0 , … , n 全部可能成功数的概率分配。若入组概率随病人风险分层而变,各 X i 不再同分布,S 通常是 Poisson–binomial 而非二项分布,尽管求和公式完全相同。
次序统计量展示如何从事件原像直接推出抽样分布。若 X 1 , … , X n 独立且有连续分布函数 F θ ,最大值 M = X ( n ) 满足
P θ ( M ≤ t ) = P θ ( X 1 ≤ t , … , X n ≤ t ) = F θ ( t ) n . 第一步把输出事件拉回原样本空间,第二步才使用独立性。若设备读数具有共同漂移,最后的乘法便失效;统计量仍是同一个最大值,抽样分布已经不是 F θ ( t ) n 。
边界与失败情形
统计量不能暗中使用未知真值。例如 T θ ( X ) = 1 { X > θ } 在未知 θ 时不是可实施的数据摘要;若检验明确给出假设值 θ 0 ,则 1 { X > θ 0 } 是合法统计量。已知设计常数、样本量以及事先生成的随机种子也可以纳入扩展样本空间。
相同公式在不同模型下会有不同抽样分布。样本均值在正态模型下精确正态,在一般有限方差模型下通常只渐近正态,在均值不存在的重尾模型中则没有围绕总体均值的通常解释。任何分布结论都必须连同生成模型复述,不能把它当成公式自带的性质。
Bootstrap 分布是在观测数据给定后,由经验分布或拟合模型重抽样得到的条件分布,用来近似未知的真实抽样分布。二者接近是一项需要证明的结论;边界参数、极值统计量与非光滑函数都可能让普通 bootstrap 失效。
可测性也不是装饰性条件。若对样本定义一个不可测的“选择规则”,P θ ( T ∈ B ) 可能没有意义,因而谈不上抽样分布。在通常 Euclidean 数据与连续、分段连续运算中可测性容易满足;涉及任意集合选择或函数空间上确界时则需要核对。
推论与应用
若 T n 的整个抽样分布不含 θ ,它是辅助统计量 公理库 辅助统计量 Ancillary statistic 抽样分布在整个参数空间中保持不变、因而不携带待估参数分布信息的统计量。 ;若某个含目标参数的标准化随机量拥有无参数分布,它可作为枢轴量反演置信集合 公理库 置信区间 Confidence interval · Confidence set 由样本决定、在重复抽样下以规定概率覆盖固定参数目标的随机集合。 。充分统计量 公理库 充分统计量 Sufficient statistic 以参数无关的条件分布保留整个模型区分能力的数据压缩,并连接因子分解与决策等价。 问的是给定 T n 后剩余样本的条件分布是否无参数,与边缘抽样分布是否含参数是两条不同轴线。
标准误是估计量抽样分布标准差,或对该标准差的可计算估计;样本标准差则描述一份数据内部的离散程度。精确分布难求时,渐近正态性 公理库 估计量的渐近正态性 Asymptotic normality of estimators 估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。 、Delta 方法与模拟提供近似,但近似对象仍是这里定义的推前分布。
参考资料
George Casella and Roger L. Berger, Statistical Inference , 2nd ed., Duxbury, 2002,§5.1。
Larry Wasserman, All of Statistics , Springer, 2004,Ch. 5–6。
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998,Ch. 2–3。