Skip to content

方法Method

Catoni 有限方差均值估计

Catoni mean estimator · Catoni 软截断均值估计

用随样本量与置信度校准的单调软截断方程估计重尾均值,证明有限方差误差界,并把括根数值容差加入最终证书。

形式陈述 ​

普通平均允许一次极大读数贡献极大的线性推力。Catoni 的方法把推力压缩为对数增长,再通过求根保持对整体平移的正确响应。它和固定阈值的稳健位置估计共享求根外形,但本页目标是干净重尾总体的均值,保证是明确 n,δ 下的有限样本误差。

设 X1,…,Xn 是实值IID 样本,均值为 μ。给定一个确定的、事前有效的方差上界 v>0,满足 Var(Xi)≤v。定义连续、奇、严格递增的函数

(1)ψ(u)={log⁡(1+u+u2/2),u≥0,−log⁡(1−u+u2/2),u<0.

预先固定 0<δ<1,记 ℓ=log⁡(2/δ)。当 n>2ℓ 时,取

(2)r=2vℓn−2ℓ,α=2ℓn(v+r2)>0.

令 Rn(θ)=∑iψ{α(Xi−θ)},以其唯一实根为估计量:

(3)Rn(μ^)=0.

则

(4)Pr(|μ^−μ|>r)≤δ.

这套选择依赖置信度:改变 δ 一般会同时改变半径和估计量本身,不能声称同一个固定估计量自动享有全部置信度的式(4)。若 n≤2ℓ,本页的参数选择不给有限半径;若已知方差上界为0,则总体几乎处处常数,任一观测即给均值,不需用除以 v 的公式。

根是否存在,计算的是哪种估计 ​

对每个有限数据集,Rn 连续严格递减,在 θ→−∞ 时趋于正无穷,在 θ→+∞ 时趋于负无穷,所以根存在且唯一。更具体地,它位于 [miniXi,maxiXi]:左端各项非负,右端各项非正。

设 ρ(u)=∫0uψ(s)ds。由于 ψ 严格递增,ρ 严格凸。样本准则

Mn(θ)=1nα2∑iρ{α(Xi−θ)}

的导数为 −Rn(θ)/(nα),故式(3)是其唯一全局极小点。这给出本方法作为M-估计的具体构造;本页的有限样本证明直接控制根,不需要先借渐近正态理论。

直觉

“软截断”指 ψ(u) 比 u 增长慢,不是把所有大观测删除,也不是把得分限制在一个固定有界区间。这里选的是 Catoni 的对数型得分,|u|→∞ 时仍然无界。

真正的校准接口是下面的两面夹逼:

(5)−log⁡(1−u+u2/2)≤ψ(u)≤log⁡(1+u+u2/2).

当 u≥0,右边取等号;左边由

(1+u+u2/2)(1−u+u2/2)=1+u4/4≥1

得到。负半轴由奇性处理。因此指数化后的得分能被二次式控制,只需原读数的二阶矩。

完整的两端括根证明 ​

固定一个确定的 θ。独立性、式(5)及 1+z≤ez 给出

(6)EeRn(θ)=∏iEeψ(α(Xi−θ))≤∏i[1+α(μ−θ)+α22E(Xi−θ)2]≤exp⁡[nα(μ−θ)+nα22{v+(μ−θ)2}].

对 −Rn(θ) 同理,第一项变为 −nα(μ−θ),二次项不变。这里原始 Xi 可以没有任何正指数矩,式(6)只要求截断后得分的指数矩。

将式(2)化简可得

αr=2ℓn,α2(v+r2)=2ℓn.

于是对右侧确定点 θ+=μ+r,式(6)右边为 e−ℓ=δ/2。由Markov 不等式,

Pr{Rn(θ+)≥0}=Pr{eRn(θ+)≥1}≤δ/2.

对左侧确定点 θ−=μ−r,使用 e−Rn 得到

Pr{Rn(θ−)≤0}≤δ/2.

用并集界,以至少 1−δ 的概率有 Rn(θ−)>0>Rn(θ+)。连续严格递减性使唯一根位于两点之间,从而证明式(4)。证明中的 μ±r 只用于分析,算法不需要知道它们。

有限样本偏差已经在证明内 ​

一般偏斜分布下 Eψ{α(X−μ)} 不等于零。例如 X∼Bernoulli(0.1)、α=1 时,它为

−0.9log⁡(1.105)+0.1log⁡(2.305)≈−0.00635273.

所以不能用“总体得分在均值处为零”代替上述证明。式(6)的二次项吸收软截断偏移,而随 n 变化的 α 把这份偏移与随机误差一同控制。固定阈值后只令 n 增加,是另一种程序。

例子与边界

一百条数据中的一次大读数 ​

已知 v=1,固定 n=100,δ=0.05。实际数据为99个0和一个10。取

ℓ=log⁡40,r≈0.2822309172,α≈0.2614086005.

需要求解

Rn(θ)=99ψ(−αθ)+ψ{α(10−θ)}=0.

直接计算 Rn(0.07)≈0.1294133>0,Rn(0.08)≈−0.1306824<0;二分进一步得到根约为

μ^≈0.0749755441.

样本平均是0.1,本方法减小了一次大读数的推力,但没有把它整条扔掉。忽略展示舍入时,统计区间约为 [−0.2072553731,0.3572064613]。例如总体以概率0.01取10、其余取0时,真实方差0.99符合 v=1;这份样本只是该模型可能产生的结果。单次区间包含0.1不是覆盖率证明,覆盖保证来自全部 IID 分布上的式(4)。

把数值容差也交给使用者 ​

本方法可由二分求根法实现。读取数据后先以样本最小、最大值括根;全部相等时直接返回该值。否则每轮计算中点处的 Rn,正值保留右半边,负值保留左半边;若能精确确认中点得分为零,直接返回这个根,数值容差为零。若已保证最终根在 [a,b],返回中点 μ~,则

|μ~−μ^|≤η=(b−a)/2.

最终应报 [μ~−(r+η),μ~+(r+η)],或直接报 [a−r,b+r]。这两个区间都包含精确根的统计区间,不额外消耗概率预算。

初始宽度 W>0,精确算术下做 k 次更新后宽度 W/2k。达到位置容差 η∗>0 至多需要

k=max{0,⌈log2⁡(W/(2η∗))⌉}

轮,每轮 O(n) 得分运算,若保留数据供重复读取则空间 O(n);已有可重读数据时额外空间 O(1)。上述样本从 [0,10] 出发,23轮给 η<10−6。

这里的宽度证书以可靠符号为前提。求和应避免溢出,计算对数宜使用稳定的 log1p 或缩放;若浮点函数评估无法判定符号,应提高精度或报告未完成,不能将 NaN 当成零。仅有小得分残差不等于根位置小误差,本页没有给得分导数的统一正下界。

方差上界、污染与选择 ​

样本方差并非自动有效的 v。99个零加一个10的样本方差恰为1,但本例的合法性来自事前预算;若所有读数为零,样本方差可能低估一个稀有大值总体。未知方差的自适应估计需要额外校准,本页不把即插即用当作定理。

也不能由“软截断”推出任意污染稳健性。固定 n≥2,α>0,取 n−1 个0与一个 A>0。对任意固定 M>0,

Rn(M)=−(n−1)ψ(αM)+ψ{α(A−M)}⟶+∞

随 A→∞ 成立。因此根最终大于每个 M:一次任意大的替换仍可把这个对数型估计推到无穷。干净 IID 有限方差模型没有允许这样的任意对手替换;影响函数与替换崩溃点需要另行判断。

查看很多个 δ、尺度或子样本后择优,也不是式(4)保护的一次预设程序。有限个方案可事先分配总错误预算;持续查看则应使用有路径保证的方法。

推论与应用

反解式(2),若要统计误差半径不超过 ε>0,充分条件为

(7)n≥⌈2log⁡(2/δ)(1+vε2)⌉.

因 v>0,右边保证 n>2ℓ。数值实现还需为根位置误差留出部分总精度,不能把式(7)的全部 ε 同时花给统计和求根误差。

取 v=1,ε=0.1,δ=0.001,式(7)给1536个样本。已有MoM的具体充分方案需要22800个,直接平均配合 Chebyshev 需要100000个。这里比较的是三份已给定常数的充分证书,不是三种方法的最优样本复杂度,也不表示 Catoni 在每份数据上误差更小。MoM 的单次遍历和本方法的重复求根成本同样应进入选择。

迁移与自测 ​

  1. 把观测换成 Y=20+3X。方差预算、α、根、统计半径和求根容差应如何改变?
  2. 若独立观测不同分布,但具有共同均值 μ、已知方差界 vi,式(6)如何改变?如果各均值不同,仅把 v 换成平均方差是否足够?

答案:第一题 vY=9v,αY=α/3,根为 20+3μ^,rY=3r,相同物理精度的数值容差也乘3。第二题乘积推导仍成立,令 v=n−1∑ivi 即得同一保证,不需要同分布;若均值为 μi、目标为平均均值,则二阶预算还包含 n−1∑i(μi−μ¯)2。忽略均值之间的差异会漏算截断偏移,不能只平均各自方差。

参考资料
  • Olivier Catoni,Challenging the empirical mean and empirical variance: A deviation study,Annales de l’Institut Henri Poincaré, Probabilités et Statistiques 48(4), 2012,1148–1185;§2,式(2.1)–(2.2)、Propositions 2.1–2.4,印刷1151–1153页。本文取其宽对数型得分,把原文单尾 ϵ 换成 δ/2,并将已知真方差放宽为确定上界;证明中保留这一不等式。
关系图谱14 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系