两台仪器都在观察同一个未知状态。一台多报几个数字,并不自动更有信息;另一台在某一个分类任务上更准,也不自动处处更好。Blackwell比较问一个更强的问题:能否只读第一台的输出,再用一套与未知状态无关的随机步骤,模拟出第二台的整个输出分布?若能,第二台能完成的任何决策,第一台都能接着完成。
形式陈述
实验是按参数排列的概率行
固定非空有限参数集Θ 和非空有限输出集X , Y 。两个统计模型 理路 统计模型与参数 Statistical model · Statistical parameter 对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。 写成实验
E = ( P θ : θ ∈ Θ ) , F = ( Q θ : θ ∈ Θ ) . 本页矩阵P 的行是参数,列是输出:P θ x = P θ ( X = x ) ,每行非负且和为一;Q 同理。参数标签及其含义必须相同,不能先任意重排真实状态再比较。
若存在行随机矩阵K = ( K x y ) ,使
(1) K x y ≥ 0 , ∑ y K x y = 1 , Q = P K , 就称E 在Blackwell意义下不弱于F ,记E ⪰ B F 。K 是从X 生成Y 的随机后处理,也称garbling。同一份K 必须同时服务全部θ 。 先知道参数再选一份核没有统计意义。
全部决策问题的等价说法
对非空有限行动集A 和损失表L ( θ , a ) ∈ [ 0 , 1 ] ,随机化决策规则 理路 估计量、决策规则与风险 Estimator and decision rule · Statistical risk 从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。 D 是输出到行动的行随机矩阵。其逐参数风险是
(2) R E ( θ , D ) = ∑ x , a P θ x D x a L ( θ , a ) . 有限Blackwell–Sherman–Stein定理说,以下三项等价:
存在式(1)的参数无关核
对每份A , L 和每份基于F 的规则D F ,有一份基于E 的规则D E ,使对全部θ 同时有R E ( θ , D E ) ≤ R F ( θ , D F )
对每份A , L 和每个参数先验π ,最优Bayes风险满足
(3) r E ∗ ( π , L ) := min D ∑ θ π θ R E ( θ , D ) ≤ r F ∗ ( π , L ) . 事实上,第3项只用一个预先固定、对全部参数赋正质量的先验,再遍历所有有限行动集和损失,已经足够。若先验漏掉某些参数,便只能比较它实际支持的子实验。
直觉
能模拟,就能接上任何行动
假设式(1)成立。先用K 从X 生成模拟输出,再使用原来的D F ,即取D E = K D F 。于是
(4) P D E = P K D F = Q D F . 它复制了每个参数下的整个行动分布 ,不只是让某个平均损失接近。因此所有损失的风险都相等,当然也不更大。这证明第1项推出第2项,再对先验平均并选最优规则,就得到第3项。
模拟出的Y 不必等于现实中另一台仪器那一次的读数。式(1)比较的是各参数下的分布。输入里没有两台仪器同时测量时的联合律,不能额外承诺把那份实际读数逐个重建出来。
如果模拟不了,总有一个决策任务揭露差距
固定P ,所有可模拟的输出矩阵组成
是 从 到 的 行 随 机 矩 阵 (5) C = { P K : K 是从 X 到 Y 的行随机矩阵 } . 它是有限个概率单纯形乘积的线性像,因而紧且凸。若Q ∉ C ,严格分离 理路 分离与支撑超平面定理 Separating hyperplane theorem · Supporting hyperplane theorem 用线性泛函分开凸集或在其边界处构造全局支撑超平面。 给一张实数表H ,使
(6) ∑ θ , y H θ y Q θ y > max K ∑ θ , y H θ y ( P K ) θ y . 选择任一全支持先验π 。先令w θ y = H θ y / π θ ,再把全部w 减去同一最小值并除以其正的极差,得到奖励表u θ y ∈ [ 0 , 1 ] 。极差不可能为零,否则式(6)两侧都是相同总质量的倍数。这个平移缩放不改变严格比较,因为每个输出矩阵的行和都为一。
取行动集就是Y ,损失L = 1 − u 。实验E 能做到的最高奖励正是式(6)右边经过同样缩放的值;实验F 至少可以“看到y 就行动y ”,达到左边。因此其最优奖励严格更高、最优损失严格更低,与式(3)冲突。
这证明第3项推出第1项。也说明没有必要逐一寻找所有任务:不可行的随机模拟,总能被一份有限损失表作为证人。固定一个任务表现较好,远远弱于这里的全称量词。
例子与边界
二元对称仪器的准确后处理
参数θ ∈ { 0 , 1 } 。仪器P p 把正确比特以概率1 − p 输出,翻转概率为p :
P p = ( 1 − p p p 1 − p ) . 若0 ≤ p ≤ q ≤ 1 / 2 且p < 1 / 2 ,再独立以概率
(7) k = q − p 1 − 2 p 翻转一次,就有P p P k = P q 。因为总翻转率为p ( 1 − k ) + ( 1 − p ) k = p + k − 2 p k 。例如p = 1 / 10 , q = 1 / 4 ,需要k = 3 / 16 ,不是简单取q − p = 3 / 20 。
当p = q = 1 / 2 ,输出完全不含参数信息,恒等核即可;不要把这个合法边界塞进式(7)的零分母。若p > 1 / 2 ,先把输出标签互换可得到误差1 − p ,所以“翻转概率数值更大”本身不等于更少信息。
两份实验可以互不占优
取三个参数{ 0 , 1 , 2 } 。实验E 确定地报告1 { θ = 0 } ;实验F 报告1 { θ = 2 } 。在E 里,参数1和2的输出律完全相同,任何参数无关后处理都不能把它们分开;F 却能。所以E ⪰̸ B F 。交换0与2,同理反向也不成立。
在均匀先验下,预测1 { θ = 0 } 这个0 –1 任务,E 风险为零,F 最优风险为1 / 3 ;预测1 { θ = 2 } 则恰好反向。这给两份明确的损失证人,而非模糊地说“两台各有优点”。
相同边缘与更长输出都不能替代比较
公平先验下,完美二元仪器的输出边缘是公平比特;完全无信息的独立公平比特也一样。二者先验预测分布相同,逐参数行却完全不同。把参数先平均掉,会丢掉本页要比较的能力。
给任何输出再附一枚独立公平硬币,会扩大输出集。原实验可以自己抛币生成它,新实验也可丢掉该位,所以两者双向Blackwell等价,却通常不是输出集合上的双射。相互可模拟是一种实验等价;它不保证每一份模拟核都存在普通矩阵逆。
推论与应用
充分统计量给双向模拟
若T ( X ) 是充分统计量 理路 充分统计量 Sufficient statistic 以参数无关的条件分布保留整个模型区分能力的数据压缩,并连接因子分解与决策等价。 ,从X 到T 有确定核;从T 到X 有同一份参数无关条件核。因此原实验与统计量实验相互可模拟,全部有限决策问题的最佳风险相同。
在本页有限合同下,反向也成立。若T 是确定统计量,而且统计量实验能够通过某核重建原实验,取任一全支持先验,原输出的后验向量记作Z X ,摘要后验为Z T = E [ Z X ∣ T ] 。条件Jensen给E ‖ Z T ‖ 2 ≤ E ‖ Z X ‖ 2 。沿反向重建核再用相同论证,就得到反向不等式,因为重建后的参数—输出联合律与原来相同。两端因此相等,条件方差分解给Z X = Z T 几乎处处。若t = T ( x ) 且相应分母为正,Bayes公式于是给P θ ( X = x ∣ T = t ) = Pr ( X = x ) / Pr ( T = t ) ,右边不含参数。这一步使用的是所有参数的共同版本,不是某一个参数下的逆向拟合。
Bayes风险 理路 Bayes 估计量与后验风险 Bayes estimator · Posterior expected loss 给定观测后最小化后验期望损失的行动规则及其条件风险。 的计算仍是逐输出最小化后验损失。Blackwell定理比较的是所有这种问题,并不承诺某个受限算法族、固定训练时间或特定估计器也必然改进。
二元参数时,后验凸序给另一份核证书
固定Pr ( θ = 1 ) = π ∈ ( 0 , 1 ) 。记E 的输出边缘和后验为
(8) m x = ( 1 − π ) P 0 x + π P 1 x , u x = π P 1 x m x , 删除m x = 0 的不可见输出。对F 相应记n y , v y 。如果Q = P K ,联合质量γ x y = m x K x y 满足
(9) ∑ x u x γ x y = n y v y . 因此粗后验V 是细后验U 给定粗信号的条件均值,其分布满足L ( V ) ⪯ c x L ( U ) 。
反之,有限凸序的鞅耦合 理路 凸序与保持条件均值的耦合 Convex order and martingale coupling · Mean-preserving spread · 凸随机序 在有限实值分布上,用所有凸函数、有限个折线探针与保持每个源点条件均值的输运表,等价刻画均值不变的分散增加。 给出具有这些边缘、且满足式(9)的表。若多个输出有相同后验值,先对后验值耦合,再按各标签的边缘质量比例拆开,便得到标签级γ 。定义K x y = γ x y / m x 。于是
( P K ) 1 y = ∑ x m x u x π γ x y m x = n y v y π = Q 1 y ; 以1 − u x 替换u x 同样得到参数0的等式。因此后验凸序也充分,并真正构造了随机核。
注意方向:信息更强的实验具有更分散的后验概率分布 。先验平均仍为π ,但观测后更容易靠近0或1。这并不意味着其最优决策风险更大;后验最优损失是后验概率的凹函数,方向恰好相反。
本页只处理有限实验。连续输出、无限参数和无限行动可能涉及可测选择、闭性及取得,不能只沿用一个矩阵式就跳过这些条件。若只能近似模拟,应该报告缺陷距离 理路 Le Cam缺陷距离与决策误差 Le Cam deficiency distance · Deficiency of statistical experiments · Randomization theorem for finite experiments 在有限实验间最小化统一随机模拟的最坏总变差误差,用有界决策风险的精确对偶及原始—对偶证书核验近似信息保留。 及其有界损失预算。实验比较与质量分配任务 要求交付核、风险证人与后验质量表。
参考资料