Skip to content

定理Theorem

Blackwell统计实验比较

Blackwell comparison of experiments · Blackwell–Sherman–Stein theorem · Blackwell informativeness order

对有限统计实验,证明参数无关的随机后处理存在,当且仅当原实验在全部有限决策问题中都不更差,并给出核与分离损失两类证书。

两台仪器都在观察同一个未知状态。一台多报几个数字,并不自动更有信息;另一台在某一个分类任务上更准,也不自动处处更好。Blackwell比较问一个更强的问题:能否只读第一台的输出,再用一套与未知状态无关的随机步骤,模拟出第二台的整个输出分布?若能,第二台能完成的任何决策,第一台都能接着完成。

形式陈述 ​

实验是按参数排列的概率行 ​

固定非空有限参数集Θ和非空有限输出集X,Y。两个统计模型写成实验

E=(Pθ:θ∈Θ),F=(Qθ:θ∈Θ).

本页矩阵P的行是参数,列是输出:Pθx=Pθ(X=x),每行非负且和为一;Q同理。参数标签及其含义必须相同,不能先任意重排真实状态再比较。

若存在行随机矩阵K=(Kxy),使

(1)Kxy≥0,∑yKxy=1,Q=PK,

就称E在Blackwell意义下不弱于F,记E⪰BF。K是从X生成Y的随机后处理,也称garbling。同一份K必须同时服务全部θ。先知道参数再选一份核没有统计意义。

全部决策问题的等价说法 ​

对非空有限行动集A和损失表L(θ,a)∈[0,1],随机化决策规则D是输出到行动的行随机矩阵。其逐参数风险是

(2)RE(θ,D)=∑x,aPθxDxaL(θ,a).

有限Blackwell–Sherman–Stein定理说,以下三项等价:

  1. 存在式(1)的参数无关核
  2. 对每份A,L和每份基于F的规则DF,有一份基于E的规则DE,使对全部θ同时有RE(θ,DE)≤RF(θ,DF)
  3. 对每份A,L和每个参数先验π,最优Bayes风险满足
(3)rE∗(π,L):=minD∑θπθRE(θ,D)≤rF∗(π,L).

事实上,第3项只用一个预先固定、对全部参数赋正质量的先验,再遍历所有有限行动集和损失,已经足够。若先验漏掉某些参数,便只能比较它实际支持的子实验。

直觉

能模拟,就能接上任何行动 ​

假设式(1)成立。先用K从X生成模拟输出,再使用原来的DF,即取DE=KDF。于是

(4)PDE=PKDF=QDF.

它复制了每个参数下的整个行动分布,不只是让某个平均损失接近。因此所有损失的风险都相等,当然也不更大。这证明第1项推出第2项,再对先验平均并选最优规则,就得到第3项。

模拟出的Y不必等于现实中另一台仪器那一次的读数。式(1)比较的是各参数下的分布。输入里没有两台仪器同时测量时的联合律,不能额外承诺把那份实际读数逐个重建出来。

如果模拟不了,总有一个决策任务揭露差距 ​

固定P,所有可模拟的输出矩阵组成

(5)C={PK:K是从X到Y的行随机矩阵}.

它是有限个概率单纯形乘积的线性像,因而紧且凸。若Q∉C,严格分离给一张实数表H,使

(6)∑θ,yHθyQθy>maxK∑θ,yHθy(PK)θy.

选择任一全支持先验π。先令wθy=Hθy/πθ,再把全部w减去同一最小值并除以其正的极差,得到奖励表uθy∈[0,1]。极差不可能为零,否则式(6)两侧都是相同总质量的倍数。这个平移缩放不改变严格比较,因为每个输出矩阵的行和都为一。

取行动集就是Y,损失L=1−u。实验E能做到的最高奖励正是式(6)右边经过同样缩放的值;实验F至少可以“看到y就行动y”,达到左边。因此其最优奖励严格更高、最优损失严格更低,与式(3)冲突。

这证明第3项推出第1项。也说明没有必要逐一寻找所有任务:不可行的随机模拟,总能被一份有限损失表作为证人。固定一个任务表现较好,远远弱于这里的全称量词。

例子与边界

二元对称仪器的准确后处理 ​

参数θ∈{0,1}。仪器Pp把正确比特以概率1−p输出,翻转概率为p:

Pp=(1−ppp1−p).

若0≤p≤q≤1/2且p<1/2,再独立以概率

(7)k=q−p1−2p

翻转一次,就有PpPk=Pq。因为总翻转率为p(1−k)+(1−p)k=p+k−2pk。例如p=1/10,q=1/4,需要k=3/16,不是简单取q−p=3/20。

当p=q=1/2,输出完全不含参数信息,恒等核即可;不要把这个合法边界塞进式(7)的零分母。若p>1/2,先把输出标签互换可得到误差1−p,所以“翻转概率数值更大”本身不等于更少信息。

两份实验可以互不占优 ​

取三个参数{0,1,2}。实验E确定地报告1{θ=0};实验F报告1{θ=2}。在E里,参数1和2的输出律完全相同,任何参数无关后处理都不能把它们分开;F却能。所以E⪰̸BF。交换0与2,同理反向也不成立。

在均匀先验下,预测1{θ=0}这个0–1任务,E风险为零,F最优风险为1/3;预测1{θ=2}则恰好反向。这给两份明确的损失证人,而非模糊地说“两台各有优点”。

相同边缘与更长输出都不能替代比较 ​

公平先验下,完美二元仪器的输出边缘是公平比特;完全无信息的独立公平比特也一样。二者先验预测分布相同,逐参数行却完全不同。把参数先平均掉,会丢掉本页要比较的能力。

给任何输出再附一枚独立公平硬币,会扩大输出集。原实验可以自己抛币生成它,新实验也可丢掉该位,所以两者双向Blackwell等价,却通常不是输出集合上的双射。相互可模拟是一种实验等价;它不保证每一份模拟核都存在普通矩阵逆。

推论与应用

充分统计量给双向模拟 ​

若T(X)是充分统计量,从X到T有确定核;从T到X有同一份参数无关条件核。因此原实验与统计量实验相互可模拟,全部有限决策问题的最佳风险相同。

在本页有限合同下,反向也成立。若T是确定统计量,而且统计量实验能够通过某核重建原实验,取任一全支持先验,原输出的后验向量记作ZX,摘要后验为ZT=E[ZX∣T]。条件Jensen给E‖ZT‖2≤E‖ZX‖2。沿反向重建核再用相同论证,就得到反向不等式,因为重建后的参数—输出联合律与原来相同。两端因此相等,条件方差分解给ZX=ZT几乎处处。若t=T(x)且相应分母为正,Bayes公式于是给Pθ(X=x∣T=t)=Pr(X=x)/Pr(T=t),右边不含参数。这一步使用的是所有参数的共同版本,不是某一个参数下的逆向拟合。

Bayes风险的计算仍是逐输出最小化后验损失。Blackwell定理比较的是所有这种问题,并不承诺某个受限算法族、固定训练时间或特定估计器也必然改进。

二元参数时,后验凸序给另一份核证书 ​

固定Pr(θ=1)=π∈(0,1)。记E的输出边缘和后验为

(8)mx=(1−π)P0x+πP1x,ux=πP1xmx,

删除mx=0的不可见输出。对F相应记ny,vy。如果Q=PK,联合质量γxy=mxKxy满足

(9)∑xuxγxy=nyvy.

因此粗后验V是细后验U给定粗信号的条件均值,其分布满足L(V)⪯cxL(U)。

反之,有限凸序的鞅耦合给出具有这些边缘、且满足式(9)的表。若多个输出有相同后验值,先对后验值耦合,再按各标签的边缘质量比例拆开,便得到标签级γ。定义Kxy=γxy/mx。于是

(PK)1y=∑xmxuxπγxymx=nyvyπ=Q1y;

以1−ux替换ux同样得到参数0的等式。因此后验凸序也充分,并真正构造了随机核。

注意方向:信息更强的实验具有更分散的后验概率分布。先验平均仍为π,但观测后更容易靠近0或1。这并不意味着其最优决策风险更大;后验最优损失是后验概率的凹函数,方向恰好相反。

本页只处理有限实验。连续输出、无限参数和无限行动可能涉及可测选择、闭性及取得,不能只沿用一个矩阵式就跳过这些条件。若只能近似模拟,应该报告缺陷距离及其有界损失预算。实验比较与质量分配任务要求交付核、风险证人与后验质量表。

参考资料
  • Brendan van Rooyen、Robert C. Williamson,Le Cam meets LeCun: Deficiency and Generic Feature Learning,2014-02-21版,§§2、4.1及Appendix7.7–7.9:有限实验、随机后处理与决策比较。本文统一采用参数为行的矩阵,并直接给出式(5)–(6)的严格分离证明;不照搬原稿中个别集合包含方向及重复公式的排字错误。
  • David Blackwell,Equivalent Comparisons of Experiments,Annals of Mathematical Statistics24(2),265–272,1953,原始定理出处。当前未取得该全文;技术核读与本文证明依据区分如上。
关系图谱14 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系