Skip to content

定义Definition

零偏置分布与正态耦合

Zero bias distribution · Zero-bias coupling · 零偏置耦合

通过中心变量的二阶加权积分构造连续的新分布,按方差替换独立和的一项,并以耦合距离控制Lipschitz损失的正态误差。

大小偏置要求变量非负,无法直接处理均值为零的正负扰动。零偏置采用另一条恒等式:左侧保留W的加权期望,右侧改用辅助变量处的导数。这个改变既适用于中心化和,也与正态分部积分直接衔接。

形式陈述 ​

恒等式定义一个新的分布 ​

设EW=0,方差 EW2=σ2∈(0,∞)。称 W∗ 具有W的零偏置分布,如果对所有连续可微、导数有界的f,

(1)E[Wf(W)]=σ2E[f′(W∗)].

这类f至多线性增长,所以左边由有限二阶矩保证绝对可积。该测试类足以唯一确定新分布。零偏置耦合则是把W和一个具有此新边缘的 W∗ 放在共同空间中;联合方式由构造者选择。

对任意满足上述条件的W,新分布存在且有Lebesgue密度

(2)p∗(x)=E[W1{W>x}]σ2=−E[W1{W≤x}]σ2.

两个表达式相等用到了EW=0。第二个表达式尤其重要:当x<0时,不能因第一个式子中出现正负W就忽略非负性。

标准化后的误差证书 ​

若σ²=1,并且当前耦合满足 E|W−W∗|<∞,则对标准正态变量 Z∼N(0,1),

(3)dW(W,Z)≤2E|W−W∗|.

这里 dW 是一阶Wasserstein距离,控制所有1-Lipschitz目标的期望差。式(3)允许W离散,而 W∗ 通常连续;它不是两者总变差小的声明。

对非标准化的中心W,先使用 (W/σ)∗=dW∗/σ。于是标准化正态误差至多为 2E|W−W∗|/σ;再换回原变量的W1尺度时要乘σ。

直觉

正态Z的恒等式为 E[Zf(Z)]=Ef′(Z)。若另一个标准化变量W也能把左侧写成 Ef′(W∗),则它与正态的差别只剩f′在W与 W∗ 两个位置取值的差。让两者在数值上靠近,就能利用f′的Lipschitz常数控制误差。

零偏置不是“把均值偏差修到零”。即使EW=0,EW∗ 也可能非零。它也不是按W本身作为概率权重;式(2)先对一段尾部做带符号积分,利用零均值把负半轴转换成非负密度。

密度为什么非负、总质量为什么为一 ​

当x≥0时,W1{W>x}≥0。当x<0时,−W1{W≤x}≥0。因此p*处处非负。

在正半轴换序,

∫0∞E[W1{W>x}]dx=E[W21{W>0}].

在负半轴用第二个表达式,同样得到

∫−∞0−E[W1{W≤x}]dx=E[W21{W<0}].

非负换序与有界导数下的Fubini积分恒等式都合法;两边相加再除以σ²,质量恰为1。对导数有界的f,把 f(W)−f(0)=∫0Wf′(x)dx 代入同样的正负半轴计算,得到

σ2∫f′(x)p∗(x)dx=E[W(f(W)−f(0))]=E[Wf(W)],

这就证明式(1)。绝对积分至多为 ‖f′‖∞EW2。

若两个候选分布均满足式(1),对任意连续紧支撑g取 f(x)=∫0xg(t)dt,它们对g的积分相同。连续紧支撑函数足以区分实线上的概率测度,因此分布唯一。没有要求不同耦合的联合分布也唯一。

例子与边界

一个两点分布变成整个区间 ​

令 B∼Bernoulli(p),0<p<1,X=B−p。它在−p和1−p取值,方差为p(1−p)。当 −p<x<1−p 时,

E[X1{X>x}]=p(1−p),

区间外对应密度为零,所以

(4)X∗∼Uniform[−p,1−p].

同样,若X在±1上各取一半概率,则 X∗∼Uniform[−1,1]。离散支撑的间隙被填满,是零偏置的实际分布变化;它与大小偏置只重新加权原非负支撑的方式不同。

式(4)的均值是1/2−p,通常不为零。这直接说明名字中的“零”描述原变量的中心化条件,不承诺新变量仍中心化。

独立和按方差选择替换项 ​

设 Xi 独立、均值为零、方差 σi2<∞,且 σ2=∑iσi2>0。选独立索引I,满足

P(I=i)=σi2σ2.

方差为零的项恒为零,不被选择。对每个被选项,取其零偏置 Xi∗,使 (Xi,Xi∗) 独立于其他原分量,并令

(5)W=∑iXi,W∗=W−XI+XI∗.

固定其余和,再对第i项用式(1),有

E[Wf(W)]=∑iσi2E[f′(W−Xi+Xi∗)]=σ2E[f′(W∗)].

所以式(5)确实给整个和的零偏置。这里抽索引的权重是方差;若误用大小偏置的均值权重,所有均值恰好都是零,构造根本无从归一化。

标准化Bernoulli负载的可算常数 ​

令独立 Bi∼Bernoulli(pi),σ2=∑ipi(1−pi)>0,并令 W=∑i(Bi−pi)/σ。按 pi(1−pi)/σ2 选I,用一个独立于原分量的 UI∼Uniform[−pI,1−pI] 替换 BI−pI。由于两端点到区间中均匀点的平均距离都为1/2,

E|(Bi−pi)−Ui|=12,E|W−W∗|=12σ.

因此式(3)给

(6)dW(W,Z)≤1σ.

p_i=0或1的确定项权重为零,可以先剥离。若400个公平Bernoulli相加,σ=10,所以W1不超过0.1。对超容量损失h(w)=max(w,0),正态答案是 Eh(Z)=1/2π,同一0.1即为其期望误差的上界。精确二项求和给 Eh(W)≈0.39869302,实际误差约0.00024926;一个统一证书可以明显大于某个特定损失的误差。

变换存在,不表示耦合预算一定有限 ​

零方差变量不满足定义的正方差条件;直接平移非中心变量也会改变式(1),应先明确使用W−EW。仅有有限方差时,式(2)仍合法,但 E|W∗| 未必有限。由同样的非负积分计算,

E|W∗|=E|W|32σ2,

允许右侧为无穷。因此标准化W虽然已有有限一阶矩,当前耦合的 E|W−W∗| 仍可能无穷,式(3)便只给无用的无穷上界,不能宣称已经取得有限近似率。

独立和替换也依赖真正的独立性。若项之间相关,固定其余和后第i项通常已不是原边缘分布,逐项套用式(1)会失效;一般依赖的零偏置构造需要额外机制。

推论与应用

证明误差界及正态固定点 ​

对任意1-Lipschitz的h,取正态Stein方程解f。它的导数有界且为2-Lipschitz,故式(1)在标准化情形给

Eh(W)−Eh(Z)=E[f′(W)−Wf(W)]=E[f′(W)−f′(W∗)].

右端绝对值至多为 2E|W−W∗|;对h取上确界即证式(3)。不需要h自身二阶可微,因此正部损失的折角没有破坏证明。

正态的分部积分使 N(0,σ2) 的零偏置仍是它本身。反之,若 W∗=dW,式(1)恢复正态刻画,所以中心正态是唯一固定分布。这是“零偏置适合正态近似”的结构原因。

独立和构造先计算并归一化方差权重,常规预处理为O(n),累计权重二分抽I为O(log n),已知总和后替换更新为O(1)次算术;还要另计生成每个 Xi∗ 的成本。本页Bernoulli例子只需一次均匀抽样,一般分布的零偏置采样并没有因此自动获得低成本算法。

参考资料
关系图谱18 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系