Skip to content

定理Theorem

Gibbs 条件原理

Gibbs conditioning principle

在稀有经验约束下,以最小相对熵分布描述固定少量样本的渐近条件规律。

形式陈述 ​

已知一大批独立样本出现了异常统计结果,再回头看其中几项,它们会像从哪个分布抽出来的?Gibbs 条件化原理把这个问题转为一个最小相对熵问题。

采用有限字母表 E,真实分布 p 每个分量均正,Xi 为IID 样本,经验向量为 Ln。以下 D(q‖p) 表示采用自然对数的KL 散度,即比特版本的 ln⁡2 倍。设 B 为概率单纯形中的闭集,内部按单纯形的相对拓扑理解,满足

infq∈B∘D(q‖p)=infq∈BD(q‖p)<∞.

再假设 B 上的最小化者 q∗ 唯一。则条件于 Ln∈B,经验向量在该条件概率下趋于 q∗;对每个固定 k,

L(X1,…,Xk∣Ln∈B)⟶(q∗)⊗k.

上式中固定坐标的联合分布按总变差收敛。这里的条件分布由正概率事件上的条件概率定义;上面的有限成本与Sanov 下界保证 P(Ln∈B)>0 对充分大的 n 成立。k 必须保持固定,不能同时取成全部 n 个样本。

直觉

稀有约束允许很多种经验分布,最小相对熵的那一种花费最少指数成本。给定约束以后,更贵的方案相对概率会指数下降,所以典型条件样本集中在 q∗ 附近。

对任何包含 q∗ 的开邻域 U,紧性、连续性和唯一性给出严格成本差

infB∖UD(q‖p)>D(q∗‖p).

条件概率是分子 P(Ln∈B∖U) 除以分母 P(Ln∈B)。Sanov 的上下界分别控制两者,成本差使该比值趋零。给定经验频率后,交换性使前 k 个坐标相当于从这份频率表无放回抽样。用耦合法把它与有放回抽样比较:先独立均匀抽取 k 个位置,只要没有重复,两组位置可取成相同;发生重复时,另抽一组均匀无放回位置。共有 (k2) 对抽样次序,每一对抽到同一位置的概率为 1/n;由并合界,至少发生一次位置碰撞的概率至多 k(k−1)/(2n),所以两种值向量的总变差也不超过这个数。固定 k 时该误差消失,而有限单纯形上的 q↦q⊗k 连续;结合条件经验律集中于 q∗,便得到所需乘积分布。

例子与边界

原样本为 Bernoulli(p),条件事件是 X―n≥q,其中 p<q<1。二元相对熵在 [q,1] 上唯一最小于 q,内部可以逼近同一成本,所以

P(X1=1∣X―n≥q)→q,P(X1=X2=1∣X―n≥q)→q2.

原始成功率没有真的被改写;这是知道全样本异常以后,对少量样本作出的条件推断。

精确等式约束需要另外处理,因为它通常没有内部。若 0<p<1,条件为 ∑i=1nXi=mn,其中 mn 是 0≤mn≤n 的整数且 mn/n→q∈[0,1],则事件有正概率。交换性直接给出(第二式取 n≥2)

P(X1=1∣∑Xi=mn)=mnn,P(X1=X2=1∣∑Xi=mn)=mn(mn−1)n(n−1)→q2.

有限 n 时两坐标仍相关,整个样本还受到总和约束;只有固定小块渐近独立。若 nq 不是整数,却直接条件于总和等于 nq,事件概率为零,普通条件概率没有定义。

唯一性不能省略。对公平硬币,约束成功比例落在 [0,q]∪[1−q,1]、0<q<1/2,有两个对称最小点。条件经验律可能分别集中在两端,少量样本的极限是相应乘积律的混合,不能任选一端作为答案。

推论与应用

线性均值约束下,最小相对熵分布常有指数族形式 qj∝pjeθg(j),参数由约束决定。它与 Cramér 倾斜相连,但“约束后看起来像新分布”是一条条件极限定理,不是只写出一个最大熵优化就自动成立。

参考资料
关系图谱18 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系