算法 ​
给定
jackknife 偏差估计
偏差修正估计为
伪值
满足
例子 ​
对样本均值,
对光滑 plug-in 统计量,删除一个观测近似其 influence function,伪值方差估计首阶抽样波动。
展开、伪值与第二个例子 ​
若统计泛函光滑并有渐近线性表示
则伪值
对
jackknife bias correction 首阶减去
delete-
边界 ​
非光滑统计量可能失败。样本中位数在小样本下许多 leave-one-out 值相同,jackknife 方差可严重失真;最大值删除非最大观测完全不变,只删除最大值产生跳跃,也不符合平滑线性近似。
偏差修正只针对可展开的首阶
观测权重不等、分层或聚类时,普通伪值公式不复制抽样设计。survey jackknife 需要 replicate weights 和相应有限总体修正。
依赖数据需 delete-block jackknife;复杂调查使用 replicate weights。逐点删除会破坏集群结构。
偏差修正可能增加方差,MSE 不一定下降。它主要消除
jackknife 与 bootstrap 的差别不只是计算次数。jackknife 用删除扰动线性化统计泛函,主要估首阶 influence、偏差与方差;bootstrap 从经验分布模拟完整条件抽样分布,可刻画偏斜和分位数,但计算更重。非光滑问题可能二者都失败,也可能 bootstrap 有效而 delete-one 不稳定。
对比样本均值的伪值恰等于原观测,说明 jackknife 没有制造新数据。伪值相关但在光滑情形首阶可像 iid influence 值使用;把它们当真正独立观测做普通小样本 t 检验,需要额外论证。
delete-
复杂估计算法中,删除一个点可能改变模型选择、聚类数或优化 basin,产生非平滑跳跃。这些跳跃是诊断信号,不应简单 winsorize 伪值让方差看起来稳定。
实现需记录每个 leave-one-out 拟合是否收敛。把失败 replicate 丢弃会低估敏感性;应修复算法、定义确定 fallback,或报告该统计量不适合 jackknife。
jackknife-after-bootstrap 可评估 bootstrap 估计对单个观测的敏感性:对每个删一数据集重用不含该观测的 bootstrap replicates。它减少重新模拟成本,却需要保存抽样索引和足够覆盖。
在 ratio estimator 中,分母接近零会让某个 leave-one-out 伪值爆炸。该现象反映真实条件性,不应仅当数值异常删除;可改用 Fieller 区间、变换或有界参数模型。
bias-corrected jackknife 的目标与 variance jackknife 不同。只报告修正点估计却继续使用未修正标准误,可能忽略两者相关;完整推断应基于同一最终统计量。
参考资料
- Maurice Quenouille, “Approximate Tests of Correlation in Time-Series,” JRSS B 11, 1949。
- John Tukey, Bias and Confidence in Not Quite Large Samples, 1958。
- Bradley Efron and Robert Tibshirani, An Introduction to the Bootstrap, 1993,Ch. 11。