完全复制另一台仪器的分布有时做不到,但差一点能复制还值得使用。关键是“差一点”要对哪些参数统一成立,又会让后续行动损失多少。缺陷距离同时回答这两个问题:一侧找同一份模拟核,另一侧寻找最能暴露模拟缺陷的决策任务。
形式陈述
方向是从手上实验模拟目标实验
沿用有限实验比较理路Blackwell统计实验比较Blackwell comparison of experiments · Blackwell–Sherman–Stein theorem · Blackwell informativeness order对有限统计实验,证明参数无关的随机后处理存在,当且仅当原实验在全部有限决策问题中都不更差,并给出核与分离损失两类证书。的行随机矩阵,参数集和输出集均非空有限。定义
核必须参数无关;有限概率单纯形紧,目标连续,所以最小值取得。本页的TV理路总变差距离Total variation distance · TV distance两个概率分布对最优可测事件所赋概率之差的最大值。是半个距离,取值在。部分文献使用不带一半的范数,其缺陷和损失常数会相差二,不能直接混抄。
恰表示能后处理成。交换两者通常改变数值。对称化定义
它在带同一参数标签的实验上是伪度量;把双向零缺陷的实验视为同一对象后,才成为度量。零距离不要求输出集同样大。
精确的随机化定理
损失限定为,行动集有限非空。以记最优Bayes风险,有
右边使用同一参数先验和同一任务比较两份实验。允许零损失保证上确界不为负;只考察某一个预定损失,一般得不到等号。
更操作化地,若某核在每个参数下的TV误差不超过,那么对任何目标规则,复合规则都满足
对全部该结论不必先让最优。式(3)则说明,把全部有界决策问题都考虑进去,最终能检测到恰好这么多的缺陷。
直觉
概率误差怎样进入行动损失
固定,给定目标输出后的平均损失为
对任意两个概率行,正负质量平衡给
令便证明式(4)。因此可以先认证一份模拟核,再把它接到许多不同任务上,而无需每换一份损失就重做概率比较。
对,振幅可达2,预算应为。对逐参数损失振幅不超过的情形,减掉该参数行的最小值后用式(5),得到。若没有统一振幅约束,任意放大损失都会放大风险差,单靠TV不能给绝对风险保证。
一份核,比每个参数各找一份核难得多
若把式(1)错误改为
结果总为零:固定某个已知后,直接忽略输入、按抽样即可。但实际模拟器不知道,只能先选统一的,再面对最坏参数。不能用这个非法交换来宣布两份实验完全等价。
例子与边界
二元对称实验的缺陷恰为多出的噪声
设,分别是误翻转率为的二元对称实验。从较精确者到较吵者可准确加噪,所以
反过来,恒等后处理给。下界无需猜核:取公平先验、猜真实比特的–损失,两边最优Bayes风险分别为与,由式(4)任何模拟核都至少留下。于是
例如,反向缺陷为。这不是上一页准确正向模拟所用的额外翻转率;一个是最优模拟误差,一个是随机核的参数。
平均缺陷小,不代表每个状态都可靠
源实验只有一个恒定输出,目标实验完美报告三种参数。任何模拟器只能固定输出一个三点分布,在参数处的误差为。因此
均匀取得最优。
若按先验平均误差,则
对应最优核始终猜第一种参数,另两个参数处的误差都是1。这说明先验加权缺陷有自己的用途,却不能冒充式(1)的统一预算。若先验把某参数权重设为零,加权零缺陷甚至可能完全忽略那一行。
只看一个估计量仍然不够
两份实验对某个常数目标都有零最优风险,但其中一份可以完全无信息,另一份可以揭示全部参数。式(3)要求遍历任务和先验,才能表征实验本身。
参数集合也必须写明。对局部参数集取得的小缺陷,不自动推广到整个全局参数空间;随着样本量改变而比较实验,还需在各自的参数对应和统一误差上另立合同。本页不由一条中心极限定理推导渐近实验等价。
推论与应用
风险下界为什么恰好达到缺陷
先写TV的有限对偶式
把最坏参数写成最坏先验,再令,就得到
核集合与集合都是有限有界多面体,目标双线性。将两侧写成各自有限顶点的凸组合,矩阵博弈极小极大定理理路矩阵博弈极小极大定理Matrix game minimax theorem · Von Neumann minimax theorem · 有限零和博弈极小极大定理有限二人零和博弈允许独立混合后,行玩家的最大保证收益等于列玩家的最小收益上界,并由一对线性规划提供精确证书。允许交换两个极值,且都取得。对最优,在时取;零先验行取任意。
固定这份先验和奖励,交换后的值是
第二项是源实验能取得的最高奖励:每个独立选最好的行动,随机化不会提高一个线性目标。第一项是目标实验采用恒等行动的奖励;目标的最优奖励只会更大。取,得到最优损失差至少为。另一方面,式(4)已经证明任何损失差不超过,故式(3)成立。
这里实际使用逐输出最优Bayes决策理路Bayes 估计量与后验风险Bayes estimator · Posterior expected loss给定观测后最小化后验期望损失的行动规则及其条件风险。,但无须除以可能为零的输出概率。式(10)保持未归一化联合质量,零概率列自动贡献零。
不必相信求解器的“成功”标签
任一行随机给可验证上界
任一合法给式(10)的下界。于是
上下相等就认证最优;差不超过则认证目标误差不超过。这是原始—对偶证书理路线性规划对偶Linear programming duality · LP duality从线性约束生成对偶界,并以弱对偶、强对偶和互补松弛连接两侧最优解。的直接形式。原问题也可用变量、及核约束,最小化。非负性、行和与残差必须一起核,单看小目标值不够。
复合与重复实验的预算
有限核不放大TV,因为其任一输出事件概率对应一个输入函数,可直接用式(5)。因此把模拟为,再模拟为,由三角不等式有
这也证明的三角不等式。若每份独立实验的模拟误差分别为,用乘积核逐份模拟,再逐项替换乘积分布,可得总TV不超过,也不超过1。此处两边都须具有所声明的条件独立乘积结构;有相关性的联合数据不能只凭各边缘小误差套用这个界。
对同一个任务,式(4)先取最坏参数,再最小化规则,给
其中是极小极大风险理路极小极大风险Minimax risk在模型族最坏参数上评价算法风险,再在所有允许算法中寻找最优值。。若双向距离小,则相同任务的Bayes或minimax值都接近;这没有承诺一个预先固定、并非最优的源算法自动达到目标性能。实验比较与质量分配任务会要求交付一份有理核和一份有理风险下界,而不只输出数值优化结果。
参考资料
- Brendan van Rooyen、Robert C. Williamson,Le Cam meets LeCun: Deficiency and Generic Feature Learning,2014-02-21版,§4、Appendix7.5–7.10:有向/加权缺陷、风险随机化定理和三角不等式。原稿使用全范数与有符号有界损失;本文改用半概率TV和损失,式(5)、(9)–(10)重新证明常数及方向。
- Lucien Le Cam,Sufficiency and approximate sufficiency,Annals of Mathematical Statistics35(4),1419–1455,1964,缺陷方法的历史出处;本页不声称取得该原文全文,也不引入一般无限实验的正则性结论。