形式陈述
两点构造
为下界极小极大风险公理库极小极大风险Minimax risk在模型族最坏参数上评价算法风险,再在所有允许算法中寻找最优值。,从参数空间挑 ,令目标距离 ,单样本分布分别为 。任意估计器 都诱导一个检验:输出离哪个参数点更近的假设。由三角不等式,若 ,该检验在参数 下必然正确。
从估计误差到检验错误
令检验为 。上面的归约给
由Neyman–Pearson 引理公理库Neyman–Pearson 引理Neyman–Pearson lemma简单零假设对简单备择下,给定显著性约束时似然比阈值检验具有最大功效。的最优似然比检验,二元检验的最小错误和恰由总变差距离公理库总变差距离Total variation distance · TV distance两个概率分布对最优可测事件所赋概率之差的最大值。刻画:
因此右侧至少为 (采用 max-risk 的常数约定)。这里的等式是共同支配测度下逐点选择较大密度一侧的结果,不是任意距离都能替换的模板。只要两个乘积分布仍难区分,就不可能在两点上同时精确估计。
直觉
两个参数若在目标损失中相隔很远,准确估计就必须知道数据来自哪一边;但若它们诱导的样本分布几乎重叠,任何检验都会频繁混淆。两点法把这两种要求并置:参数距离制造误差尺度,统计距离控制不可辨识概率。
样本数增加会把乘积分布推远,因此候选间隔不能固定不变。典型构造让单样本 KL 为 ,使总 KL 保持常数,同时让参数距离尽可能大;这份平衡直接产生估计速率。
例子与边界
Bernoulli 均值例子
估计 Bernoulli 均值,取 、,则参数间隔为 。单样本KL 散度公理库KL 散度Kullback–Leibler divergence · Relative entropy同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。在小 时为 ,而独立乘积满足
由 Pinsker 不等式,TV 至多为 。选择 且 足够小,TV 保持严格小于 ,于是任何估计器都以常数概率有 绝对误差。这给出匹配样本均值上界的速率。
数据处理视角与边界
估计器是观测的函数,数据处理不等式公理库数据处理不等式Data processing inequality对 Markov 链 X→Y→Z,有 I(X;Z)≤I(X;Y)。说明它不能增加区分两分布的信息。证明中不能把单样本 KL 直接当作 样本 KL;乘 来自独立乘积。两点法善于得到一维或单方向速率,却常看不见高维的 因子;这时要构造 packing 并用 Fano,或使用 Assouad 超立方体。若损失不是度量,参数间隔到检验正确性的那一步需按损失几何重新证明。
推论与应用
把尾概率下界乘以 ,即可得到 型损失的风险下界。Bernoulli 例子取 ,给出均值估计的 绝对误差或 平方误差量级,与样本均值上界匹配。
当困难只沿一个自然方向发生时,两点法最简洁;需要维数因子时,应改用 Packing–Fano 或 Assouad,把多个可区分方向同时编码进候选集合。方法选择取决于参数几何,而不是下界定理名称的强弱排序。
参考资料
- Lucien Le Cam, Asymptotic Methods in Statistical Decision Theory, Springer, 1986.
- Alexandre Tsybakov, Introduction to Nonparametric Estimation, Springer, 2009.