形式陈述
只想估计一个均值,不代表整个数据分布只含一个未知数。协变量如何分布、结果在每层如何波动、哪些结果更容易被记录,都可能未知。半参数效率回答:允许这些未知部分变化时,一个能够正确追踪目标的估计量,首阶抽样方差最低能到哪里?
用一维路径探查一个大模型
设观测 O 1 , … , O n 独立同分布于模型 P 中的 P ,目标是实数泛函 ψ ( P ) 。固定 P ,考虑经过它的子模型 { P t : | t | < δ } ⊂ P ,其中 P 0 = P 。假定它们相对于同一测度 ν 有密度,并满足二次均值可微条件
∫ { p t − p − t 2 s p } 2 d ν = o ( t 2 ) . 函数 s 称为这条路径在 P 的得分,满足 E P s = 0 、E P s 2 < ∞ 。平方根展开让路径能够接入渐近效率 公理库 渐近效率 Asymptotic efficiency 用局部正则性解释信息效率界,并以 Hodges 的精确风险计算区分逐点超效率与收缩邻域风险。 中的局部正则比较;逐点对密度求导而没有积分控制,不能替代这个条件。
在均值为零、二阶矩有限的函数空间
L 0 2 ( P ) = { f : E P f = 0 , E P f 2 < ∞ } , ⟨ f , h ⟩ = E P ( f h ) 中,取所有允许路径得分的线性张成,再取 L 2 闭包,得到统计切空间 T 。这里的向量是观测的函数;“闭包”把可以用得分组合在均方意义下逼近的方向也包括进来。
假定目标沿每条路径可微,且导数只由得分决定,并延拓成 T 上的连续线性泛函:
d d t ψ ( P t ) | t = 0 = ψ ˙ ( s ) . 由 Hilbert 空间的 Riesz 表示定理 公理库 Hilbert 空间 Riesz 表示定理 Riesz representation theorem for Hilbert spaces Hilbert 空间上的每个连续线性泛函都唯一由与某向量取内积表示。 ,存在唯一 g ∈ T ,使
ψ ˙ ( s ) = E P ( g s ) , s ∈ T . 这个 g 称为典范梯度,也称有效影响函数。它不仅要正确给出所有方向的目标导数,还必须属于模型自己的切空间。两个要求合在一起才确定唯一答案。
正交分解给出效率界
比较具有渐近线性展开的估计量
n { ψ ^ n − ψ ( P ) } = 1 n ∑ i = 1 n ϕ ( O i ) + o P ( 1 ) , ϕ ∈ L 0 2 ( P ) , 并要求它沿所有上述局部子模型正则。此时影响函数满足得分恒等式
E P ( ϕ s ) = ψ ˙ ( s ) . 恒等式表达的是“估计量必须跟得上目标”。沿 P h / n ,局部似然极限与 Le Cam 第三引理使线性项的极限均值移动 h E P ( ϕ s ) ,而真目标移动 h ψ ˙ ( s ) 。正则性要求以移动真目标为中心后的极限不随 h 改变,因此两项必须相等。这一步是局部统计实验的结论;仅有固定 P 下的渐近线性还不够。
把 ϕ 与 g 的恒等式相减,有 E P [ ( ϕ − g ) s ] = 0 。先对所有得分成立,再由线性性和连续性推广到整个 T ,于是 ϕ − g ∈ T ⊥ 。正交投影 公理库 Hilbert 空间投影定理 Hilbert projection theorem · Projection theorem Hilbert 空间中每个闭线性子空间都给出唯一的正交分解与最近点投影。 与勾股恒等式给出
g = Π T ϕ , E P ϕ 2 = E P g 2 + E P ( ϕ − g ) 2 ≥ E P g 2 . 因此 E P g 2 是这类正则渐近线性估计量的效率界系数;等号恰在 ϕ = g 几乎处处时成立。中心极限定理给出的一般首阶正态近似方差是 E P ϕ 2 / n ,达到效率界时才为 E P g 2 / n 。若没有额外矩收敛条件,不应把它写成有限样本方差的精确展开。更广估计量类别的卷积下界需要进一步定理,不由这条勾股公式单独推出。
直觉
每个得分方向代表一种模型允许的小变化。一个合格的影响函数与它配对后,应准确报告目标沿这个方向的移动。加入一个与全部得分正交的函数,不会改变任何导数答案,却会增加抽样波动。有效影响函数正好去掉这部分额外波动。
这也说明效率为什么依赖模型。宣布某个采样概率已知,相当于删去改变它的得分方向;宣布它未知,则必须通过更多局部扰动的检验。同一个看起来无偏的公式,在这两种模型中可能承担不同的角色。
例子与边界
随机缺失均值:先写清观测模型
完整数据为 ( X , Y ) ,实际记录
O = ( X , R , R Y ) , R ∈ { 0 , 1 } . X 总能看到,R = 1 时才看到 Y ;记录中保留 R ,所以“缺失时填零”和“实际结果为零”仍能区分。假定随机缺失 公理库 缺失数据机制 Missing-data mechanism · MCAR · MAR · MNAR 用观测指示变量的条件分布描述哪些数据被保留,并区分完全随机、随机和非随机缺失及忽略机制的条件。 R ⊥ Y ∣ X ,记
π ( x ) = P ( R = 1 ∣ X = x ) , m ( x ) = E ( Y ∣ X = x ) , ψ = E ( Y ) = E [ m ( X ) ] . 本例在一个内部模型点工作:| Y | ≤ M < ∞ ,且存在 ε > 0 使 ε ≤ π ( X ) ≤ 1 − ε 。模型允许 P X 、Y ∣ X 的分布和 π 分别变化,三者没有额外参数约束。正性与 MAR 让已观察结果识别每层的 m ;有界条件则使以下路径、配对和二阶矩都可直接核查。
观测密度按三部分分解:
p O ( o ) = p X ( x ) π ( x ) r { 1 − π ( x ) } 1 − r p Y ∣ X ( y ∣ x ) r . 相应的路径得分分成
s ( O ) = a ( X ) + ( R − π ( X ) ) b ( X ) + R c ( X , Y ) , E [ a ( X ) ] = 0 , E [ c ( X , Y ) ∣ X ] = 0. 第一项改变人群组成,第二项改变记录概率,第三项改变组内结果分布。三个分量两两正交:条件于 X ,R − π 的均值为零;凡含 c 的交叉项,再用 MAR 和 E ( c ∣ X ) = 0 即消失。
目标沿这条路径的导数为
ψ ˙ ( s ) = E [ ( m ( X ) − ψ ) a ( X ) ] + E [ ( Y − m ( X ) ) c ( X , Y ) ] . 改变记录概率不会改变完整数据均值,所以没有 b 项。这个零导数将成为检验某个候选影响函数是否合格的重要条件。
构造有效影响函数并验证两个义务
候选函数是
g ( O ) = m ( X ) − ψ + R π ( X ) { Y − m ( X ) } . 其第二项在 R = 0 时定义为零,不需要取得缺失的 Y 。由条件期望 公理库 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 ,E g = 0 。分别与三类得分配对可得
E [ g a ] = E [ ( m − ψ ) a ] , E [ g ( R − π ) b ] = 0 , E [ g R c ] = E [ ( Y − m ) c ] . 最后一行用到了 R 2 = R 与 E ( R ∣ X , Y ) = π ( X ) 。这证明 g 正确表示目标导数。
还要证明 g ∈ T 。取有界均值零函数 a = m − ψ ,路径 d P X , t = ( 1 + t a ) d P X 在足够小的正负 t 下有效,其得分正是 a 。再令 c = ( Y − m ) / π ,它有界且条件均值为零;用
d P Y ∣ X , t ( y ∣ x ) = { 1 + t c ( x , y ) } d P Y ∣ X ( y ∣ x ) 改变组内结果分布,观测得分就是 R c 。两个密度倾斜都保持归一化与非负性,有界性允许对平方根作一致 Taylor 展开,因而满足前面的二次均值可微条件。g 是这两个得分之和,确实在 T 中,效率证明闭合。
将 g 的两项平方并条件于 X ,交叉项为零,得到
V eff = Var ( m ( X ) ) + E [ Var ( Y ∣ X ) π ( X ) ] . 完整观测的均值方差系数是 Var ( m ) + E Var ( Y ∣ X ) 。缺失增加的部分恰为 E [ Var ( Y ∣ X ) ( 1 / π − 1 ) ] :组间组成仍由全体 X 记录,组内结果波动则需要由更少的可见结果承担。
两层人群:效率界怎样变成一个数
令 P ( X = 0 ) = P ( X = 1 ) = 1 / 2 ,并取
人群
m ( x )
给定 X = x 的 Y (各概率 1 / 2 )
π ( x )
x = 0
0
− 1 , 1
1 / 4
x = 1
2
1 , 3
3 / 4
两层组内方差均为 1 ,总体均值 ψ = 1 ,组间均值方差为 1 。因此完整数据系数为 2 ,缺失数据效率界为
V eff = 1 + 1 2 ( 4 + 4 3 ) = 11 3 . 在这个有限分层模型中,界可以由可执行估计量达到。记 n x 为该层所有记录数,n x 1 为其中可见结果数,以层内可见均值 Y ¯ x , obs 构造
ψ ^ = ∑ x = 0 1 n x n Y ¯ x , obs . 若某层没有可见结果,先为其均值指定任意固定有界值;由于两层可见概率为正,这种事件概率随 n 指数下降。对有限个样本比例与比值作一阶展开,组别比例变化产生 m ( X ) − ψ ,组内可见均值变化产生 R ( Y − m ) / π ,两者之和正是 g 。各分母的总体值为正,展开余项为 O P ( n − 1 ) ;同一光滑展开在局部子模型中也成立,因而该估计量正则且达到 11 / 3 的首阶系数。它无需预先知道两层的 m 或 π 。
已知设计 IPW 的额外方差
现在单独考虑记录概率由实验设计给定、已知等于上表的模型。普通逆概率加权平均为 n − 1 ∑ i R i Y i / π ( X i ) ,影响函数是 h = R Y / π − ψ 。计算得
E ( h 2 ) = 1 2 ( 1 1 / 4 + 5 3 / 4 ) − 1 = 13 3 . 它与有效影响函数的差为
d = h − g = ( R π − 1 ) m , E ( g d ) = 0 , E ( d 2 ) = 2 3 . 已知设计的切空间不含改变 π 的方向;d 与其余两类得分都正交。g 的两条构造路径仍合法,所以有效界仍是 11 / 3 ,普通 IPW 多出的 2 / 3 正是额外正交噪声。
若 π 未知,直接把真实 π 放进普通 IPW 是 oracle 公式,不能据此宣称得到可行估计量。它甚至不能作为未知模型中正则估计量的影响函数:此时 d = ( R − π ) m / π 本身是允许的倾向得分方向,目标沿它的导数为零,但 E ( h d ) = 2 / 3 ≠ 0 ,违反得分恒等式。实际估计 π 后,估计误差也会贡献一阶项,必须重新推导影响函数。
推论与应用
从效率计算回到估计方法
有效影响函数指明应该消除哪种首阶噪声,却不会自动提供任意函数模型中的拟合速率。一般协变量空间下,使用估计的 m , π 构造增广平均,需要控制 nuisance 误差及随机余项;双重稳健估计 公理库 双重稳健估计 Doubly robust estimation · Augmented inverse probability weighting · AIPW 合并结局回归与处理概率,使任一 nuisance 模型正确时仍一致估计因果均值的方法。 进一步解释交叉拟合和乘积速率如何实现这一接口。能抵消某一种模型误设,与达到这里的效率界,是两个不同的结论。
已知设计与未知设计本例具有相同有效界,是因为 g 已经正交于记录概率的变化。其他模型删去干扰方向后,界可能严格下降;不能把本例的相等推广为“估计干扰量从来没有代价”。
若允许 π 任意接近零,E [ Var ( Y ∣ X ) / π ] 可能无穷。此时前述 L 2 有效影响函数论证失去矩条件。若 MAR 或覆盖本身失败,则更早出现识别障碍:还不能确定要估计的完整均值,谈其正则效率界也必须先换模型。
自测
将两层设计改成 π ( 0 ) = π ( 1 ) = 1 / 2 ,其他分布保持不变。有效系数是多少?已知设计普通 IPW 的额外系数又是多少?由方差分解,前者为 1 + 2 = 3 ;后者为 E [ m ( X ) 2 ( 2 − 1 ) ] = 2 ,所以普通 IPW 系数为 5 。这个计算定位了浪费:所有人的 X 都已记录,普通 IPW 却仍让人群均值部分随结果是否缺失而额外波动。
参考资料
A. W. van der Vaart, Semiparametric Statistics , St-Flour 1999 讲义扩充稿,收入 Lectures on Probability Theory and Statistics , Springer, 2002。所链讲义 §1.2、页内 12–13 的 Definition 1.14 及投影讨论;页内 41 的 Example 4.6 给出渐近线性估计与正则得分恒等式的联系。
Edward H. Kennedy, “Semiparametric theory” , arXiv:1709.06418, 2017,§§1、3–5:缺失均值、已知倾向的普通 IPW、切空间与有效影响函数。本文另在有界 MAR 模型中逐项证明得分配对、切空间成员资格和方差分解。