Skip to content

定理Theorem

Le Cam缺陷距离与决策误差

Le Cam deficiency distance · Deficiency of statistical experiments · Randomization theorem for finite experiments

在有限实验间最小化统一随机模拟的最坏总变差误差,用有界决策风险的精确对偶及原始—对偶证书核验近似信息保留。

完全复制另一台仪器的分布有时做不到,但差一点能复制还值得使用。关键是“差一点”要对哪些参数统一成立,又会让后续行动损失多少。缺陷距离同时回答这两个问题:一侧找同一份模拟核,另一侧寻找最能暴露模拟缺陷的决策任务。

形式陈述 ​

方向是从手上实验模拟目标实验 ​

沿用有限实验比较的行随机矩阵Pθx,Qθy,参数集Θ和输出集均非空有限。定义

(1)δ(E,F)=minK:X⇝Ymaxθ∈Θ‖PθK−Qθ‖TV.

核必须参数无关;有限概率单纯形紧,目标连续,所以最小值取得。本页的TV是半个ℓ1距离,取值在[0,1]。部分文献使用不带一半的范数,其缺陷和损失常数会相差二,不能直接混抄。

δ(E,F)=0恰表示E能后处理成F。交换两者通常改变数值。对称化定义

(2)Δ(E,F)=max{δ(E,F),δ(F,E)}.

它在带同一参数标签的实验上是伪度量;把双向零缺陷的实验视为同一对象后,才成为度量。零距离不要求输出集同样大。

精确的随机化定理 ​

损失限定为0≤L(θ,a)≤1,行动集有限非空。以r∗记最优Bayes风险,有

(3)δ(E,F)=supπ,A,L{rE∗(π,L)−rF∗(π,L)}.

右边使用同一参数先验和同一任务比较两份实验。允许零损失保证上确界不为负;只考察某一个预定损失,一般得不到等号。

更操作化地,若某核K在每个参数下的TV误差不超过ε,那么对任何目标规则DF,复合规则KDF都满足

(4)RE(θ,KDF)≤RF(θ,DF)+ε对全部 θ.

该结论不必先让DF最优。式(3)则说明,把全部有界决策问题都考虑进去,最终能检测到恰好这么多的缺陷。

直觉

概率误差怎样进入行动损失 ​

固定θ,给定目标输出y后的平均损失为

hθ(y)=∑aDF(y,a)L(θ,a)∈[0,1].

对任意两个概率行p,q,正负质量平衡给

(5)|∑y(py−qy)h(y)|≤‖p−q‖TV(0≤h≤1).

令p=PθK,q=Qθ便证明式(4)。因此可以先认证一份模拟核,再把它接到许多不同任务上,而无需每换一份损失就重做概率比较。

对|L|≤1,振幅可达2,预算应为2ε。对逐参数损失振幅不超过B的情形,减掉该参数行的最小值后用式(5),得到Bε。若没有统一振幅约束,任意放大损失都会放大风险差,单靠TV不能给绝对风险保证。

一份核,比每个参数各找一份核难得多 ​

若把式(1)错误改为

maxθminK‖PθK−Qθ‖TV,

结果总为零:固定某个已知θ后,直接忽略输入、按Qθ抽样即可。但实际模拟器不知道θ,只能先选统一的K,再面对最坏参数。不能用这个非法交换来宣布两份实验完全等价。

例子与边界

二元对称实验的缺陷恰为多出的噪声 ​

设0≤p≤q≤1/2,Pp,Pq分别是误翻转率为p,q的二元对称实验。从较精确者到较吵者可准确加噪,所以

δ(Pp,Pq)=0.

反过来,恒等后处理给δ(Pq,Pp)≤q−p。下界无需猜核:取公平先验、猜真实比特的0–1损失,两边最优Bayes风险分别为q与p,由式(4)任何模拟核都至少留下q−p。于是

(6)δ(Pq,Pp)=Δ(Pp,Pq)=q−p.

例如p=1/10,q=1/4,反向缺陷为3/20。这不是上一页准确正向模拟所用的额外翻转率3/16;一个是最优模拟误差,一个是随机核的参数。

平均缺陷小,不代表每个状态都可靠 ​

源实验只有一个恒定输出,目标实验完美报告三种参数。任何模拟器只能固定输出一个三点分布k,在参数θ处的误差为1−kθ。因此

(7)δ(E,F)=1−maxkminθkθ=2/3,

均匀k取得最优。

若按先验π=(4/5,1/10,1/10)平均误差,则

(8)δπ(E,F):=minK∑θπθ‖PθK−Qθ‖TV=1−maxθπθ=1/5.

对应最优核始终猜第一种参数,另两个参数处的误差都是1。这说明先验加权缺陷有自己的用途,却不能冒充式(1)的统一预算。若先验把某参数权重设为零,加权零缺陷甚至可能完全忽略那一行。

只看一个估计量仍然不够 ​

两份实验对某个常数目标都有零最优风险,但其中一份可以完全无信息,另一份可以揭示全部参数。式(3)要求遍历任务和先验,才能表征实验本身。

参数集合也必须写明。对局部参数集取得的小缺陷,不自动推广到整个全局参数空间;随着样本量改变而比较实验,还需在各自的参数对应和统一误差上另立合同。本页不由一条中心极限定理推导渐近实验等价。

推论与应用

风险下界为什么恰好达到缺陷 ​

先写TV的有限对偶式

‖Qθ−PθK‖TV=max0≤uθy≤1∑yuθy(Qθy−(PK)θy).

把最坏参数写成最坏先验,再令wθy=πθuθy,就得到

(9)δ=minKmaxπ,w∑θ,ywθy(Qθy−(PK)θy),π≥0, ∑θπθ=1, 0≤wθy≤πθ.

核集合与(π,w)集合都是有限有界多面体,目标双线性。将两侧写成各自有限顶点的凸组合,矩阵博弈极小极大定理允许交换两个极值,且都取得。对最优(π,w),在πθ>0时取u=w/πθ;零先验行取任意u∈[0,1]。

固定这份先验和奖励,交换后的值是

(10)D(π,u)=∑θ,yπθQθyuθy−∑xmaxy∑θπθPθxuθy.

第二项是源实验能取得的最高奖励:每个x独立选最好的行动y,随机化不会提高一个线性目标。第一项是目标实验采用恒等行动的奖励;目标的最优奖励只会更大。取L=1−u,得到最优损失差至少为D(π,u)=δ。另一方面,式(4)已经证明任何损失差不超过δ,故式(3)成立。

这里实际使用逐输出最优Bayes决策,但无须除以可能为零的输出概率。式(10)保持未归一化联合质量,零概率列自动贡献零。

不必相信求解器的“成功”标签 ​

任一行随机K给可验证上界

U(K)=maxθ12∑y|(PK)θy−Qθy|.

任一合法π,u给式(10)的下界。于是

(11)D(π,u)≤δ(E,F)≤U(K).

上下相等就认证最优;差不超过η则认证目标误差不超过η。这是原始—对偶证书的直接形式。原问题也可用变量zθy≥±((PK)θy−Qθy)、12∑yzθy≤t及核约束,最小化t。非负性、行和与残差必须一起核,单看小目标值不够。

复合与重复实验的预算 ​

有限核不放大TV,因为其任一输出事件概率对应一个[0,1]输入函数,可直接用式(5)。因此把E模拟为F,再模拟为G,由三角不等式有

(12)δ(E,G)≤δ(E,F)+δ(F,G).

这也证明Δ的三角不等式。若每份独立实验的模拟误差分别为ε1,…,εn,用乘积核逐份模拟,再逐项替换乘积分布,可得总TV不超过∑iεi,也不超过1。此处两边都须具有所声明的条件独立乘积结构;有相关性的联合数据不能只凭各边缘小误差套用这个界。

对同一个[0,1]任务,式(4)先取最坏参数,再最小化规则,给

RE∗(L)≤RF∗(L)+δ(E,F),

其中R∗是极小极大风险。若双向距离小,则相同任务的Bayes或minimax值都接近;这没有承诺一个预先固定、并非最优的源算法自动达到目标性能。实验比较与质量分配任务会要求交付一份有理核和一份有理风险下界,而不只输出数值优化结果。

参考资料
  • Brendan van Rooyen、Robert C. Williamson,Le Cam meets LeCun: Deficiency and Generic Feature Learning,2014-02-21版,§4、Appendix7.5–7.10:有向/加权缺陷、风险随机化定理和三角不等式。原稿使用全ℓ1范数与有符号有界损失;本文改用半ℓ1概率TV和[0,1]损失,式(5)、(9)–(10)重新证明常数及方向。
  • Lucien Le Cam,Sufficiency and approximate sufficiency,Annals of Mathematical Statistics35(4),1419–1455,1964,缺陷方法的历史出处;本页不声称取得该原文全文,也不引入一般无限实验的正则性结论。
关系图谱14 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系