Skip to content

方法Method

交叉拟合与正交得分

Cross-fitting and orthogonal score

逐折隔离 nuisance 拟合,并用条件化与乘积余项说明何时样本外得分能进行根号样本量推断。

形式陈述 ​

交叉拟合先把样本分成互不相交的评价折;评价某条观测时,使用没有见过这条观测的 nuisance 拟合。它是一项训练与评价协议,不自动带来独立的折间估计量,也不自动创造识别或正交性。

设 Oi 为 IID 观测,将下标 {1,…,n} 按预先固定或独立于数据的随机方式分成 K≥2 折 I1,…,IK。K 固定,nk=|Ik| 满足 nk/n≥c>0。在补集 Ikc 上拟合 η^(−k),对 i∈Ik 计算 ϕ(Oi;η^(−k)),再按实际折大小汇总:

μ^=∑k=1KnknPn,kϕη^(−k),Pn,kf=1nk∑i∈Ikf(Oi).

所有预处理、变量筛选和调参必须包含在“补集上拟合”之内。如果先用全数据选择模型,再仅重新拟合系数,评价折仍参与了学习。

用缺失结局均值说明正交得分 ​

观测 O=(X,R,RY),其中 R=1 才能看到 Y。目标是 μ=EY。假设缺失机制满足 E(Y∣X,R=1)=E(Y∣X)=m(X),e(X)=P(R=1∣X)≥ε>0,并有 m∈L2(PX) 与 Var(Y∣X,R=1)≤C。只需条件均值的 MAR 版本;缺失者的完整分布无需在本页额外指定。

令 η=(m,e),对任意候选 e~≥ε,定义

ϕ(O;m~,e~)=m~(X)+Re~(X){Y−m~(X)}.

R=0 时残差项直接记为零,不需要读取缺失的 Y。利用条件期望,对固定候选函数得到精确恒等式

Pϕη~−μ=E[e~−ee~(m~−m)].

因此偏差对两个 nuisance 误差是一项乘积:在真值处只改变其中一个函数,其一阶方向导数为零。这是本例的正交性。它与双重稳健相容,但由不同责任构成:代数恒等式负责总体偏差,交叉拟合负责控制在同一样本上评价拟合得分的随机项。

足够进行一阶推断的逐折条件 ​

对每个折,要求 e^(−k)≥ε,‖m^(−k)−m‖2=oP(1)、‖e^(−k)−e‖2=oP(1),并且

‖m^(−k)−m‖2‖e^(−k)−e‖2=oP(n−1/2).

范数在一条新的 X∼PX 上计算,并条件于该折训练资料理解其随机性。最后假定真实得分方差 σ2=Var{ϕ(O;m,e)}>0。以上有限矩与下界条件使该方差有限。则

n(μ^−μ)=1n∑i{ϕ(Oi;m,e)−μ}+oP(1)⇒N(0,σ2).
直觉

每折留出的数据像一次临时的独立测试:条件于训练资料后,nuisance 函数已固定,而留出观测仍按原分布独立产生。这让我们控制“用拟合函数替换真实函数后,评价平均增加了多少随机噪声”。正交性另把平均偏差降为两个误差的乘积。少了任何一项,不能从“做了交叉拟合”四个字推出正态区间。

二折交叉拟合的数据流

余项账本及证明 ​

写 hk=ϕη^(−k)−ϕη0、wk=nk/n。直接加减期望有

μ^−μ=(Pn−P)ϕη0+∑kwk(Pn,k−P)hk+∑kwkPhk.

最后一项是偏差。由上面的恒等式和Cauchy–Schwarz 不等式,

|Phk|≤ε−1‖e^(−k)−e‖2‖m^(−k)−m‖2=oP(n−1/2).

中间一项是评价噪声。展开得分差为

hk=(1−R/e^)(m^−m)+R(Y−m)(1/e^−1/e).

分母下界与条件方差上界给 ‖hk‖L2(P)≤C1‖m^−m‖2+C2‖e^−e‖2=oP(1)。条件于 Ikc 及其拟合随机种子,留出折仍 IID,所以中心化评价均值的条件方差至多 ‖hk‖22/nk。条件版Chebyshev 不等式推出 n(Pn,k−P)hk=oP(1);若随机方差只依概率趋零,可先限制到 ‖hk‖22≤δ 的高概率事件,再令 δ↓0,无需假设其期望也趋零。

固定 K 个小 oP 项相加仍是小 oP,不要求不同折独立。首项对固定真实得分应用中心极限定理,再由Slutsky 定理去掉余项,完成结论。

例子与边界

四条记录的索引级执行 ​

令已知观察概率为 e=1/2。第一折 I1={1,2}:第1条 R=1,Y=2,第2条 R=0;第二折 I2={3,4}:两条均 R=1,观测结局为4和6。用“训练集中已观察结局的平均”作为常数回归器。

评价第一折时只能在 {3,4} 上训练,得到 m^(−1)=5,两个得分为 5+2(2−5)=−1 与5。评价第二折时在 {1,2} 上训练,得到 m^(−2)=2,两个得分为6和10。因此 μ^=(−1+5+6+10)/4=5。

这共训练两次、评价四个得分。若两种 nuisance 都须学习,就是每折各训练一个结局模型和一个观察概率模型;总训练成本为各折完整学习器成本之和,评价阶段为 O(n) 次预测与标量运算。训练折没有任何已观察结局时,这个具体学习器无定义,必须预先指定失败或后备规则,不能偷看评价折填补。

若错误地用全数据拟合常数回归,常数变为4,四个得分变为 0,4,4,8,最后得到4。两种输出之差只说明执行协议真的不同,这个小样本不证明其中某个数更接近未知总体均值,也不验证渐近速率。

L² 中完美的拟合仍可能在复用数据时失败 ​

令 X∼Uniform[0,1],R∼Bernoulli(1/2),Y∼N(0,1),三者独立。真实 m=0、e=1/2。构造一个故意记忆训练资料的拟合器:在训练中 Ri=1 的位置 Xi 返回 Yi,在 Ri=0 的位置返回1,在其他位置返回0。

由于训练位置只有有限个,一条新的连续 X 以概率一不会命中它们;这个拟合器相对于真实 m 的 L2(PX) 误差恰为零。然而若在原训练样本上评价,得分为 RiYi+(1−Ri),其平均趋于 1/2,不是目标零。失败的是条件独立评价步骤,不能用人口范数替代对样本自适应选点的控制。

按交叉拟合执行时,留出 Xi 以概率一不等于任何训练位置,所以得到预测0、得分 2RiYi。其均值为零、方差为2,普通IID平均理论恢复适用。这个反例用来定位数据复用风险,不建议采用这种学习器。

推论与应用

用各条样本外得分 ϕ^i 构造 σ^2=n−1∑i(ϕ^i−μ^)2。逐折条件化先给 Pn,khk2=oP(1),再由 Cauchy–Schwarz 控制真实与拟合得分平方之差,结合真实得分的大数律得到 σ^2→Pσ2;标准误为 σ^/n。四行算例的经验方差为 31/2,标准误为 31/8,只是一项可复算输出,不是四个样本已经支持名义覆盖的证据。

交叉拟合不能修复缺失不随机、缺乏观察概率下界或错误的目标定义。若有家庭等相关单元,应按独立单元分折;随机拆散同一家庭的行可能重新引入依赖。重复很多次分折并挑最显著结果,也超出了预先固定协议的保证。

自测与答案 ​

  1. 两个 nuisance 误差分别为 OP(n−0.30) 和 OP(n−0.25),乘积条件是否足够?答案:乘积为 OP(n−0.55)=oP(n−1/2),足够;两者都只有 OP(n−1/4) 则仅得到大 OP(n−1/2),不足以由这条界排除一阶偏差。
  2. 五折拟合是否让五个折均值独立?答案:不。训练集彼此大量重叠;证明逐折条件化,然后利用固定有限项相加,不采用折间独立性。
参考资料
  • Victor Chernozhukov 等,Double/Debiased Machine Learning for Treatment and Structural Parameters,arXiv v7,2024-11-03,§3.1,Definitions 3.1–3.2、Theorems 3.1–3.2:交叉拟合与正交得分的原始一般框架。本文只证明固定分布、固定折数、缺失均值的充分版本,不宣称原论文的分布一致保证。
  • 同文 §5.1 及其附录证明:增广逆概率得分的正交性与 nuisance 误差乘积。本页使用单臂缺失均值形式,并在正文给出完整条件化账本。
关系图谱20 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系