形式陈述
普通平均允许一次极大读数贡献极大的线性推力。Catoni 的方法把推力压缩为对数增长,再通过求根保持对整体平移的正确响应。它和固定阈值的稳健位置估计共享求根外形,但本页目标是干净重尾总体的均值,保证是明确 下的有限样本误差。
设 是实值IID 样本理路独立同分布样本IID sample · Independent and identically distributed sample以乘积分布描述来自同一总体的独立重复观测。,均值为 。给定一个确定的、事前有效的方差理路方差Variance随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。上界 ,满足 。定义连续、奇、严格递增的函数
预先固定 ,记 。当 时,取
令 ,以其唯一实根为估计量:
则
这套选择依赖置信度:改变 一般会同时改变半径和估计量本身,不能声称同一个固定估计量自动享有全部置信度的式(4)。若 ,本页的参数选择不给有限半径;若已知方差上界为0,则总体几乎处处常数,任一观测即给均值,不需用除以 的公式。
根是否存在,计算的是哪种估计
对每个有限数据集, 连续严格递减,在 时趋于正无穷,在 时趋于负无穷,所以根存在且唯一。更具体地,它位于 :左端各项非负,右端各项非正。
设 。由于 严格递增, 严格凸。样本准则
的导数为 ,故式(3)是其唯一全局极小点。这给出本方法作为M-估计理路M-估计M-estimation · M-estimator通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。的具体构造;本页的有限样本证明直接控制根,不需要先借渐近正态理论。
直觉
“软截断”指 比 增长慢,不是把所有大观测删除,也不是把得分限制在一个固定有界区间。这里选的是 Catoni 的对数型得分, 时仍然无界。
真正的校准接口是下面的两面夹逼:
当 ,右边取等号;左边由
得到。负半轴由奇性处理。因此指数化后的得分能被二次式控制,只需原读数的二阶矩。
完整的两端括根证明
固定一个确定的 。独立性、式(5)及 给出
对 同理,第一项变为 ,二次项不变。这里原始 可以没有任何正指数矩,式(6)只要求截断后得分的指数矩。
将式(2)化简可得
于是对右侧确定点 ,式(6)右边为 。由Markov 不等式理路Markov 不等式Markov's inequality非负随机变量超过阈值的概率由其期望除以阈值控制。,
对左侧确定点 ,使用 得到
用并集界理路并集界Union bound · Boole 不等式多个坏事件中至少一个发生的概率,不超过各事件概率之和。,以至少 的概率有 。连续严格递减性使唯一根位于两点之间,从而证明式(4)。证明中的 只用于分析,算法不需要知道它们。
有限样本偏差已经在证明内
一般偏斜分布下 不等于零。例如 、 时,它为
所以不能用“总体得分在均值处为零”代替上述证明。式(6)的二次项吸收软截断偏移,而随 变化的 把这份偏移与随机误差一同控制。固定阈值后只令 增加,是另一种程序。
例子与边界
一百条数据中的一次大读数
已知 ,固定 。实际数据为99个0和一个10。取
需要求解
直接计算 ,;二分进一步得到根约为
样本平均是0.1,本方法减小了一次大读数的推力,但没有把它整条扔掉。忽略展示舍入时,统计区间约为 。例如总体以概率0.01取10、其余取0时,真实方差0.99符合 ;这份样本只是该模型可能产生的结果。单次区间包含0.1不是覆盖率证明,覆盖保证来自全部 IID 分布上的式(4)。
把数值容差也交给使用者
本方法可由二分求根法理路二分求根法Bisection method以端点异号区间为不变量,给出可验证误差界、对数成本和有限精度停止条件。实现。读取数据后先以样本最小、最大值括根;全部相等时直接返回该值。否则每轮计算中点处的 ,正值保留右半边,负值保留左半边;若能精确确认中点得分为零,直接返回这个根,数值容差为零。若已保证最终根在 ,返回中点 ,则
最终应报 ,或直接报 。这两个区间都包含精确根的统计区间,不额外消耗概率预算。
初始宽度 ,精确算术下做 次更新后宽度 。达到位置容差 至多需要
轮,每轮 得分运算,若保留数据供重复读取则空间 ;已有可重读数据时额外空间 。上述样本从 出发,23轮给 。
这里的宽度证书以可靠符号为前提。求和应避免溢出,计算对数宜使用稳定的 log1p 或缩放;若浮点函数评估无法判定符号,应提高精度或报告未完成,不能将 NaN 当成零。仅有小得分残差不等于根位置小误差,本页没有给得分导数的统一正下界。
方差上界、污染与选择
样本方差并非自动有效的 。99个零加一个10的样本方差恰为1,但本例的合法性来自事前预算;若所有读数为零,样本方差可能低估一个稀有大值总体。未知方差的自适应估计需要额外校准,本页不把即插即用当作定理。
也不能由“软截断”推出任意污染稳健性。固定 ,取 个0与一个 。对任意固定 ,
随 成立。因此根最终大于每个 :一次任意大的替换仍可把这个对数型估计推到无穷。干净 IID 有限方差模型没有允许这样的任意对手替换;影响函数理路稳健统计与影响函数Robust statistics · Influence function以污染邻域和统计泛函导数量化少量异常分布对估计的局部影响。与替换崩溃点需要另行判断。
查看很多个 、尺度或子样本后择优,也不是式(4)保护的一次预设程序。有限个方案可事先分配总错误预算;持续查看则应使用有路径保证的方法。
推论与应用
反解式(2),若要统计误差半径不超过 ,充分条件为
因 ,右边保证 。数值实现还需为根位置误差留出部分总精度,不能把式(7)的全部 同时花给统计和求根误差。
取 ,式(7)给1536个样本。已有MoM理路分组均值中位数估计Median-of-means estimator · MoM 均值估计将独立样本分成不相交的组,先平均再取中位数,以有限方差取得依赖置信度的均值误差保证,并明确组数、余数和尺度条件。的具体充分方案需要22800个,直接平均配合 Chebyshev 需要100000个。这里比较的是三份已给定常数的充分证书,不是三种方法的最优样本复杂度,也不表示 Catoni 在每份数据上误差更小。MoM 的单次遍历和本方法的重复求根成本同样应进入选择。
迁移与自测
- 把观测换成 。方差预算、、根、统计半径和求根容差应如何改变?
- 若独立观测不同分布,但具有共同均值 、已知方差界 ,式(6)如何改变?如果各均值不同,仅把 换成平均方差是否足够?
答案:第一题 ,,根为 ,,相同物理精度的数值容差也乘3。第二题乘积推导仍成立,令 即得同一保证,不需要同分布;若均值为 、目标为平均均值,则二阶预算还包含 。忽略均值之间的差异会漏算截断偏移,不能只平均各自方差。
参考资料