Skip to content

定理Theorem

半参数效率与有效影响函数

Semiparametric efficiency · Efficient influence function · Canonical gradient · 典范梯度

用可微子模型的得分空间刻画正则估计的首阶方差界,并完整求出随机缺失均值的有效影响函数。

形式陈述 ​

只想估计一个均值,不代表整个数据分布只含一个未知数。协变量如何分布、结果在每层如何波动、哪些结果更容易被记录,都可能未知。半参数效率回答:允许这些未知部分变化时,一个能够正确追踪目标的估计量,首阶抽样方差最低能到哪里?

用一维路径探查一个大模型 ​

设观测 O1,…,On 独立同分布于模型 P 中的 P,目标是实数泛函 ψ(P)。固定 P,考虑经过它的子模型 {Pt:|t|<δ}⊂P,其中 P0=P。假定它们相对于同一测度 ν 有密度,并满足二次均值可微条件

∫{pt−p−t2sp}2dν=o(t2).

函数 s 称为这条路径在 P 的得分,满足 EPs=0、EPs2<∞。平方根展开让路径能够接入渐近效率中的局部正则比较;逐点对密度求导而没有积分控制,不能替代这个条件。

在均值为零、二阶矩有限的函数空间

L02(P)={f:EPf=0, EPf2<∞},⟨f,h⟩=EP(fh)

中,取所有允许路径得分的线性张成,再取 L2 闭包,得到统计切空间 T。这里的向量是观测的函数;“闭包”把可以用得分组合在均方意义下逼近的方向也包括进来。

假定目标沿每条路径可微,且导数只由得分决定,并延拓成 T 上的连续线性泛函:

ddtψ(Pt)|t=0=ψ˙(s).

由 Hilbert 空间的 Riesz 表示定理,存在唯一 g∈T,使

ψ˙(s)=EP(gs),s∈T.

这个 g 称为典范梯度,也称有效影响函数。它不仅要正确给出所有方向的目标导数,还必须属于模型自己的切空间。两个要求合在一起才确定唯一答案。

正交分解给出效率界 ​

比较具有渐近线性展开的估计量

n{ψ^n−ψ(P)}=1n∑i=1nϕ(Oi)+oP(1),ϕ∈L02(P),

并要求它沿所有上述局部子模型正则。此时影响函数满足得分恒等式

EP(ϕs)=ψ˙(s).

恒等式表达的是“估计量必须跟得上目标”。沿 Ph/n,局部似然极限与 Le Cam 第三引理使线性项的极限均值移动 hEP(ϕs),而真目标移动 hψ˙(s)。正则性要求以移动真目标为中心后的极限不随 h 改变,因此两项必须相等。这一步是局部统计实验的结论;仅有固定 P 下的渐近线性还不够。

把 ϕ 与 g 的恒等式相减,有 EP[(ϕ−g)s]=0。先对所有得分成立,再由线性性和连续性推广到整个 T,于是 ϕ−g∈T⊥。正交投影与勾股恒等式给出

g=ΠTϕ,EPϕ2=EPg2+EP(ϕ−g)2≥EPg2.

因此 EPg2 是这类正则渐近线性估计量的效率界系数;等号恰在 ϕ=g 几乎处处时成立。中心极限定理给出的一般首阶正态近似方差是 EPϕ2/n,达到效率界时才为 EPg2/n。若没有额外矩收敛条件,不应把它写成有限样本方差的精确展开。更广估计量类别的卷积下界需要进一步定理,不由这条勾股公式单独推出。

直觉

每个得分方向代表一种模型允许的小变化。一个合格的影响函数与它配对后,应准确报告目标沿这个方向的移动。加入一个与全部得分正交的函数,不会改变任何导数答案,却会增加抽样波动。有效影响函数正好去掉这部分额外波动。

这也说明效率为什么依赖模型。宣布某个采样概率已知,相当于删去改变它的得分方向;宣布它未知,则必须通过更多局部扰动的检验。同一个看起来无偏的公式,在这两种模型中可能承担不同的角色。

例子与边界

随机缺失均值:先写清观测模型 ​

完整数据为 (X,Y),实际记录

O=(X,R,RY),R∈{0,1}.

X 总能看到,R=1 时才看到 Y;记录中保留 R,所以“缺失时填零”和“实际结果为零”仍能区分。假定随机缺失 R⊥Y∣X,记

π(x)=P(R=1∣X=x),m(x)=E(Y∣X=x),ψ=E(Y)=E[m(X)].

本例在一个内部模型点工作:|Y|≤M<∞,且存在 ε>0 使 ε≤π(X)≤1−ε。模型允许 PX、Y∣X 的分布和 π 分别变化,三者没有额外参数约束。正性与 MAR 让已观察结果识别每层的 m;有界条件则使以下路径、配对和二阶矩都可直接核查。

观测密度按三部分分解:

pO(o)=pX(x)π(x)r{1−π(x)}1−rpY∣X(y∣x)r.

相应的路径得分分成

s(O)=a(X)+(R−π(X))b(X)+Rc(X,Y),E[a(X)]=0,E[c(X,Y)∣X]=0.

第一项改变人群组成,第二项改变记录概率,第三项改变组内结果分布。三个分量两两正交:条件于 X,R−π 的均值为零;凡含 c 的交叉项,再用 MAR 和 E(c∣X)=0 即消失。

目标沿这条路径的导数为

ψ˙(s)=E[(m(X)−ψ)a(X)]+E[(Y−m(X))c(X,Y)].

改变记录概率不会改变完整数据均值,所以没有 b 项。这个零导数将成为检验某个候选影响函数是否合格的重要条件。

构造有效影响函数并验证两个义务 ​

候选函数是

g(O)=m(X)−ψ+Rπ(X){Y−m(X)}.

其第二项在 R=0 时定义为零,不需要取得缺失的 Y。由条件期望,Eg=0。分别与三类得分配对可得

E[ga]=E[(m−ψ)a],E[g(R−π)b]=0,E[gRc]=E[(Y−m)c].

最后一行用到了 R2=R 与 E(R∣X,Y)=π(X)。这证明 g 正确表示目标导数。

还要证明 g∈T。取有界均值零函数 a=m−ψ,路径 dPX,t=(1+ta)dPX 在足够小的正负 t 下有效,其得分正是 a。再令 c=(Y−m)/π,它有界且条件均值为零;用

dPY∣X,t(y∣x)={1+tc(x,y)}dPY∣X(y∣x)

改变组内结果分布,观测得分就是 Rc。两个密度倾斜都保持归一化与非负性,有界性允许对平方根作一致 Taylor 展开,因而满足前面的二次均值可微条件。g 是这两个得分之和,确实在 T 中,效率证明闭合。

将 g 的两项平方并条件于 X,交叉项为零,得到

Veff=Var(m(X))+E[Var(Y∣X)π(X)].

完整观测的均值方差系数是 Var(m)+EVar(Y∣X)。缺失增加的部分恰为 E[Var(Y∣X)(1/π−1)]:组间组成仍由全体 X 记录,组内结果波动则需要由更少的可见结果承担。

两层人群:效率界怎样变成一个数 ​

令 P(X=0)=P(X=1)=1/2,并取

人群 m(x) 给定 X=x 的 Y(各概率 1/2) π(x)
x=0 0 −1,1 1/4
x=1 2 1,3 3/4

两层组内方差均为 1,总体均值 ψ=1,组间均值方差为 1。因此完整数据系数为 2,缺失数据效率界为

Veff=1+12(4+43)=113.

在这个有限分层模型中,界可以由可执行估计量达到。记 nx 为该层所有记录数,nx1 为其中可见结果数,以层内可见均值 Y¯x,obs 构造

ψ^=∑x=01nxnY¯x,obs.

若某层没有可见结果,先为其均值指定任意固定有界值;由于两层可见概率为正,这种事件概率随 n 指数下降。对有限个样本比例与比值作一阶展开,组别比例变化产生 m(X)−ψ,组内可见均值变化产生 R(Y−m)/π,两者之和正是 g。各分母的总体值为正,展开余项为 OP(n−1);同一光滑展开在局部子模型中也成立,因而该估计量正则且达到 11/3 的首阶系数。它无需预先知道两层的 m 或 π。

已知设计 IPW 的额外方差 ​

现在单独考虑记录概率由实验设计给定、已知等于上表的模型。普通逆概率加权平均为 n−1∑iRiYi/π(Xi),影响函数是 h=RY/π−ψ。计算得

E(h2)=12(11/4+53/4)−1=133.

它与有效影响函数的差为

d=h−g=(Rπ−1)m,E(gd)=0,E(d2)=23.

已知设计的切空间不含改变 π 的方向;d 与其余两类得分都正交。g 的两条构造路径仍合法,所以有效界仍是 11/3,普通 IPW 多出的 2/3 正是额外正交噪声。

若 π 未知,直接把真实 π 放进普通 IPW 是 oracle 公式,不能据此宣称得到可行估计量。它甚至不能作为未知模型中正则估计量的影响函数:此时 d=(R−π)m/π 本身是允许的倾向得分方向,目标沿它的导数为零,但 E(hd)=2/3≠0,违反得分恒等式。实际估计 π 后,估计误差也会贡献一阶项,必须重新推导影响函数。

推论与应用

从效率计算回到估计方法 ​

有效影响函数指明应该消除哪种首阶噪声,却不会自动提供任意函数模型中的拟合速率。一般协变量空间下,使用估计的 m,π 构造增广平均,需要控制 nuisance 误差及随机余项;双重稳健估计进一步解释交叉拟合和乘积速率如何实现这一接口。能抵消某一种模型误设,与达到这里的效率界,是两个不同的结论。

已知设计与未知设计本例具有相同有效界,是因为 g 已经正交于记录概率的变化。其他模型删去干扰方向后,界可能严格下降;不能把本例的相等推广为“估计干扰量从来没有代价”。

若允许 π 任意接近零,E[Var(Y∣X)/π] 可能无穷。此时前述 L2 有效影响函数论证失去矩条件。若 MAR 或覆盖本身失败,则更早出现识别障碍:还不能确定要估计的完整均值,谈其正则效率界也必须先换模型。

自测 ​

将两层设计改成 π(0)=π(1)=1/2,其他分布保持不变。有效系数是多少?已知设计普通 IPW 的额外系数又是多少?由方差分解,前者为 1+2=3;后者为 E[m(X)2(2−1)]=2,所以普通 IPW 系数为 5。这个计算定位了浪费:所有人的 X 都已记录,普通 IPW 却仍让人群均值部分随结果是否缺失而额外波动。

参考资料
  • A. W. van der Vaart, Semiparametric Statistics, St-Flour 1999 讲义扩充稿,收入 Lectures on Probability Theory and Statistics, Springer, 2002。所链讲义 §1.2、页内 12–13 的 Definition 1.14 及投影讨论;页内 41 的 Example 4.6 给出渐近线性估计与正则得分恒等式的联系。
  • Edward H. Kennedy, “Semiparametric theory”, arXiv:1709.06418, 2017,§§1、3–5:缺失均值、已知倾向的普通 IPW、切空间与有效影响函数。本文另在有界 MAR 模型中逐项证明得分配对、切空间成员资格和方差分解。
关系图谱14 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系