形式陈述
在统计模型 公理库 统计模型与参数 Statistical model · Statistical parameter 对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。 { P θ ( n ) : θ ∈ Θ } 中,随机样本 X ( n ) 取值于可测空间 ( X n , A n ) 。统计量是一个在抽样前已经确定的可测映射
T n : ( X n , A n ) → ( T n , B n ) , 其计算规则不能使用未知的 θ 。随机元素 公理库 随机变量 Random variable · Random element 从概率空间到可测取值空间的可测映射;实值情形承载数值概率运算。 T n ( X ( n ) ) 在 P θ ( n ) 下的推前分布
Q θ , n = L θ , n ( T n ) = P θ ( n ) ∘ T n − 1 , 称为 T n 的抽样分布;具体地,Q θ , n ( B ) = P θ ( n ) { T n ( X ( n ) ) ∈ B } 。规则 T n 不含未知参数,抽样分布却通常同时随 θ 、n 与抽样设计改变。若数据是IID 样本 公理库 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,才可把 P θ ( n ) 专门写成 P θ ⊗ n 。
统计量可以是标量、向量、函数、集合或概率测度。样本均值、次序统计量、经验分布和完整样本本身都符合定义。一个统计量只有在被指定去估计某个目标时才成为估计量;同一 T n 也可能用于检验、模型诊断或构造区间,定义本身不评价优劣。
直觉
统计量是固定的数据处理规则,抽样分布则把这个规则放回一遍遍重复的同一实验中,记录输出如何波动。现实中只看到一次实现 t obs = T n ( x ) ;整条分布来自“模型 + 参数 + 设计 + 规则”,是标准误、置信覆盖与检验阈值的校准对象。
可以沿一次数据流区分四个对象:随机样本 X ( n ) 、已观察数值 x 、固定映射 T n 、以及输出随机量的律 Q θ , n 。样本直方图或经验分布是从这份 x 算出的统计量;它们本身不等于在重复采样中形成的抽样分布。
抽样设计的影响可以直接算出来。设总体恰有两个固定数值 0 , 2 ,抽两次后求均值。有放回独立抽样得到均值 0 , 1 , 2 ,概率分别为 1 / 4 , 1 / 2 , 1 / 4 ,所以均值的抽样方差为 1 / 2 。不放回抽遍总体时均值恒为 1 ,方差为零。同一个求平均公式,由于实验设计不同,产生完全不同的抽样分布。
例子与边界
若一台测量仪的独立重复读数满足 X i ∼ N ( μ , σ 2 ) ,统计量
X ¯ = 1 n ∑ i = 1 n X i 满足精确抽样分布
X ¯ ∼ N ( μ , σ 2 n ) . X ¯ 的计算公式没有未知参数;它的中心和尺度却含 ( μ , σ ) 。表达式 ( X ¯ − μ ) / ( σ / n ) 是用来研究分布或反演区间的参数化随机量,若 μ , σ 未知,就不是一份数据单独能够计算的统计量。
仅把 σ 换成样本标准差 S ,仍留下未知的 μ ,所以 ( X ¯ − μ ) / ( S / n ) 是枢轴量而非可直接计算的统计量。若检验给定假设值 μ 0 ,则
T μ 0 = X ¯ − μ 0 S / n 才是统计量。在 μ = μ 0 、n ≥ 2 的正态 IID 模型下,它精确服从 t n − 1 ;其他均值下则是非中心 t 分布。这里要同时区分“公式能否由数据计算”与“哪一个参数值下有哪条分布”。
二元临床结局的 Bernoulli 样本中,S = ∑ i X i 是总成功数,且
S ∼ Binomial ( n , θ ) . 观测到 S = s 只是这条二项分布的一次实现;抽样分布仍是对 0 , … , n 全部可能成功数的概率分配。若入组概率随病人风险分层而变,各 X i 不再同分布,S 通常是 Poisson–binomial 而非二项分布,尽管求和公式完全相同。
次序统计量展示如何从事件原像直接推出抽样分布。若 X 1 , … , X n 独立且有连续分布函数 F θ ,最大值 M = X ( n ) 满足
P θ ( M ≤ t ) = P θ ( X 1 ≤ t , … , X n ≤ t ) = F θ ( t ) n . 第一步把输出事件拉回原样本空间,第二步才使用独立性。若设备读数具有共同漂移,最后的乘法便失效;统计量仍是同一个最大值,抽样分布已经不是 F θ ( t ) n 。
对最大值作位置尺度归一化后,极值类型定理 公理库 Fisher–Tippett–Gnedenko 极值定理 Fisher-Tippett-Gnedenko theorem · Extreme types theorem 独立同分布最大值若存在线性归一化后的非退化极限,该极限必属于广义极值分布族。 进一步分类所有可能的非退化极限,但不保证任意总体都存在这样的极限。
边界与失败情形
统计量不能暗中使用未知真值。例如 T θ ( X ) = 1 { X > θ } 在未知 θ 时不是可实施的数据摘要;若检验明确给出假设值 θ 0 ,则 1 { X > θ 0 } 是合法统计量。已知设计常数、样本量以及事先生成的随机种子也可以纳入扩展样本空间。
相同公式在不同模型下会有不同抽样分布。样本均值在正态模型下精确正态,在一般有限方差模型下通常只渐近正态,在均值不存在的重尾模型中则没有围绕总体均值的通常解释。任何分布结论都必须连同生成模型复述,不能把它当成公式自带的性质。
Bootstrap 公理库 Bootstrap Bootstrap resampling · Nonparametric bootstrap 用条件重采样律近似抽样误差:完整计算均值的有限分布,证明有限方差下一致性,并由最大值的持久原子判定失败。 分布是在观测数据给定后,由经验分布或拟合模型重抽样得到的条件分布,用来近似未知的真实抽样分布。固定原数据时,理想条件律已经确定;有限 B 次重采样得到的直方图只是它的 Monte Carlo 估计。换一份原数据,理想条件律本身也会改变。这与模型给定后不再随观测样本改变的真实抽样律是两类对象。
最大值公式可以直接用于检验两者是否接近:真实分布为 F θ ( t ) n ,给定样本后的经验重采样分布则为 F n ( t ) n 。在连续 Uniform 上界模型中,原最大值唯一,后者在它上面放置 1 − ( 1 − 1 / n ) n 的质量。居中并按 n 放大后,该质量仍留在误差零点,趋于 1 − e − 1 ;真实误差却趋于无原子的指数律。因而重采样能执行、分布公式能写出,都不等于它已正确近似目标。Bootstrap 页给出完整三点枚举及这一失败的距离下界。
可测性也不是装饰性条件。若对样本定义一个不可测的“选择规则”,P θ ( T ∈ B ) 可能没有意义,因而谈不上抽样分布。在通常 Euclidean 数据与连续、分段连续运算中可测性容易满足;涉及任意集合选择或函数空间上确界时则需要核对。
推论与应用
若 T n 的整个抽样分布不含 θ ,它是辅助统计量 公理库 辅助统计量 Ancillary statistic 抽样分布在整个参数空间中保持不变、因而不携带待估参数分布信息的统计量。 ;若某个含目标参数的标准化随机量拥有无参数分布,它可作为枢轴量反演置信集合 公理库 置信区间 Confidence interval · Confidence set 以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。 。充分统计量 公理库 充分统计量 Sufficient statistic 以参数无关的条件分布保留整个模型区分能力的数据压缩,并连接因子分解与决策等价。 问的是给定 T n 后剩余样本的条件分布是否无参数,与边缘抽样分布是否含参数是两条不同轴线。
标准误是估计量抽样分布标准差,或对该标准差的可计算估计;样本标准差则描述一份数据内部的离散程度。精确分布难求时,渐近正态性 公理库 估计量的渐近正态性 Asymptotic normality of estimators 估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。 、Delta 方法与模拟提供近似,但近似对象仍是这里定义的推前分布。
抽样分布不仅用于评价已有估计,也可以反过来指导怎样收集资料。分层抽样与 Neyman 分配 公理库 分层抽样与 Neyman 分配 Stratified sampling · Neyman allocation 在独立层内抽样的精确方差上优化人数或费用分配,说明 Neyman 公式与实际整数约束。 从层内均值的设计方差出发,在固定人数或成本约束下分配样本,把精度目标变成可执行的设计选择。
参考资料
George Casella and Roger L. Berger, Statistical Inference , 2nd ed., Duxbury, 2002,§5.1。
Larry Wasserman, All of Statistics , Springer, 2004,Ch. 5–6。
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998,Ch. 2–3。