形式陈述
交叉拟合先把样本分成互不相交的评价折;评价某条观测时,使用没有见过这条观测的 nuisance 拟合。它是一项训练与评价协议,不自动带来独立的折间估计量,也不自动创造识别或正交性。
设 O i 为 IID 观测 理路 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,将下标 { 1 , … , n } 按预先固定或独立于数据的随机方式分成 K ≥ 2 折 I 1 , … , I K 。K 固定,n k = | I k | 满足 n k / n ≥ c > 0 。在补集 I k c 上拟合 η ^ ( − k ) ,对 i ∈ I k 计算 ϕ ( O i ; η ^ ( − k ) ) ,再按实际折大小汇总:
μ ^ = ∑ k = 1 K n k n P n , k ϕ η ^ ( − k ) , P n , k f = 1 n k ∑ i ∈ I k f ( O i ) . 所有预处理、变量筛选和调参必须包含在“补集上拟合”之内。如果先用全数据选择模型,再仅重新拟合系数,评价折仍参与了学习。
用缺失结局均值说明正交得分
观测 O = ( X , R , R Y ) ,其中 R = 1 才能看到 Y 。目标是 μ = E Y 。假设缺失机制 理路 缺失数据机制 Missing-data mechanism · MCAR · MAR · MNAR 用观测指示变量的条件分布描述哪些数据被保留,并区分完全随机、随机和非随机缺失及忽略机制的条件。 满足 E ( Y ∣ X , R = 1 ) = E ( Y ∣ X ) = m ( X ) ,e ( X ) = P ( R = 1 ∣ X ) ≥ ε > 0 ,并有 m ∈ L 2 ( P X ) 与 Var ( Y ∣ X , R = 1 ) ≤ C 。只需条件均值的 MAR 版本;缺失者的完整分布无需在本页额外指定。
令 η = ( m , e ) ,对任意候选 e ~ ≥ ε ,定义
ϕ ( O ; m ~ , e ~ ) = m ~ ( X ) + R e ~ ( X ) { Y − m ~ ( X ) } . R = 0 时残差项直接记为零,不需要读取缺失的 Y 。利用条件期望 理路 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 ,对固定候选函数得到精确恒等式
P ϕ η ~ − μ = E [ e ~ − e e ~ ( m ~ − m ) ] . 因此偏差对两个 nuisance 误差是一项乘积:在真值处只改变其中一个函数,其一阶方向导数为零。这是本例的正交性。它与双重稳健 理路 双重稳健估计 Doubly robust estimation · Augmented inverse probability weighting · AIPW 合并结局回归与处理概率,使任一 nuisance 模型正确时仍一致估计因果均值的方法。 相容,但由不同责任构成:代数恒等式负责总体偏差,交叉拟合负责控制在同一样本上评价拟合得分的随机项。
足够进行一阶推断的逐折条件
对每个折,要求 e ^ ( − k ) ≥ ε ,‖ m ^ ( − k ) − m ‖ 2 = o P ( 1 ) 、‖ e ^ ( − k ) − e ‖ 2 = o P ( 1 ) ,并且
‖ m ^ ( − k ) − m ‖ 2 ‖ e ^ ( − k ) − e ‖ 2 = o P ( n − 1 / 2 ) . 范数在一条新的 X ∼ P X 上计算,并条件于该折训练资料理解其随机性。最后假定真实得分方差 σ 2 = Var { ϕ ( O ; m , e ) } > 0 。以上有限矩与下界条件使该方差有限。则
n ( μ ^ − μ ) = 1 n ∑ i { ϕ ( O i ; m , e ) − μ } + o P ( 1 ) ⇒ N ( 0 , σ 2 ) .
直觉
每折留出的数据像一次临时的独立测试:条件于训练资料后,nuisance 函数已固定,而留出观测仍按原分布独立产生。这让我们控制“用拟合函数替换真实函数后,评价平均增加了多少随机噪声”。正交性另把平均偏差降为两个误差的乘积。少了任何一项,不能从“做了交叉拟合”四个字推出正态区间。
图片加载失败 二折交叉拟合的数据流 余项账本及证明
写 h k = ϕ η ^ ( − k ) − ϕ η 0 、w k = n k / n 。直接加减期望有
μ ^ − μ = ( P n − P ) ϕ η 0 + ∑ k w k ( P n , k − P ) h k + ∑ k w k P h k . 最后一项是偏差。由上面的恒等式和Cauchy–Schwarz 不等式 理路 Cauchy–Schwarz 不等式 Cauchy–Schwarz inequality · 柯西–施瓦茨不等式 内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。 ,
| P h k | ≤ ε − 1 ‖ e ^ ( − k ) − e ‖ 2 ‖ m ^ ( − k ) − m ‖ 2 = o P ( n − 1 / 2 ) . 中间一项是评价噪声。展开得分差为
h k = ( 1 − R / e ^ ) ( m ^ − m ) + R ( Y − m ) ( 1 / e ^ − 1 / e ) . 分母下界与条件方差上界给 ‖ h k ‖ L 2 ( P ) ≤ C 1 ‖ m ^ − m ‖ 2 + C 2 ‖ e ^ − e ‖ 2 = o P ( 1 ) 。条件于 I k c 及其拟合随机种子,留出折仍 IID,所以中心化评价均值的条件方差至多 ‖ h k ‖ 2 2 / n k 。条件版Chebyshev 不等式 理路 Chebyshev 不等式 Chebyshev's inequality 随机变量偏离均值至少给定距离的概率由方差除以距离平方控制。 推出 n ( P n , k − P ) h k = o P ( 1 ) ;若随机方差只依概率趋零,可先限制到 ‖ h k ‖ 2 2 ≤ δ 的高概率事件,再令 δ ↓ 0 ,无需假设其期望也趋零。
固定 K 个小 o P 项相加仍是小 o P ,不要求不同折独立。首项对固定真实得分应用中心极限定理 理路 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 ,再由Slutsky 定理 理路 Slutsky 定理 Slutsky's theorem 依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。 去掉余项,完成结论。
例子与边界
四条记录的索引级执行
令已知观察概率为 e = 1 / 2 。第一折 I 1 = { 1 , 2 } :第1条 R = 1 , Y = 2 ,第2条 R = 0 ;第二折 I 2 = { 3 , 4 } :两条均 R = 1 ,观测结局为4和6。用“训练集中已观察结局的平均”作为常数回归器。
评价第一折时只能在 { 3 , 4 } 上训练,得到 m ^ ( − 1 ) = 5 ,两个得分为 5 + 2 ( 2 − 5 ) = − 1 与5。评价第二折时在 { 1 , 2 } 上训练,得到 m ^ ( − 2 ) = 2 ,两个得分为6和10。因此 μ ^ = ( − 1 + 5 + 6 + 10 ) / 4 = 5 。
这共训练两次、评价四个得分。若两种 nuisance 都须学习,就是每折各训练一个结局模型和一个观察概率模型;总训练成本为各折完整学习器成本之和,评价阶段为 O ( n ) 次预测与标量运算。训练折没有任何已观察结局时,这个具体学习器无定义,必须预先指定失败或后备规则,不能偷看评价折填补。
若错误地用全数据拟合常数回归,常数变为4,四个得分变为 0 , 4 , 4 , 8 ,最后得到4。两种输出之差只说明执行协议真的不同,这个小样本不证明其中某个数更接近未知总体均值,也不验证渐近速率。
L² 中完美的拟合仍可能在复用数据时失败
令 X ∼ Uniform [ 0 , 1 ] ,R ∼ Bernoulli ( 1 / 2 ) ,Y ∼ N ( 0 , 1 ) ,三者独立。真实 m = 0 、e = 1 / 2 。构造一个故意记忆训练资料的拟合器:在训练中 R i = 1 的位置 X i 返回 Y i ,在 R i = 0 的位置返回1,在其他位置返回0。
由于训练位置只有有限个,一条新的连续 X 以概率一不会命中它们;这个拟合器相对于真实 m 的 L 2 ( P X ) 误差恰为零。然而若在原训练样本上评价,得分为 R i Y i + ( 1 − R i ) ,其平均趋于 1 / 2 ,不是目标零。失败的是条件独立评价步骤,不能用人口范数替代对样本自适应选点的控制。
按交叉拟合执行时,留出 X i 以概率一不等于任何训练位置,所以得到预测0、得分 2 R i Y i 。其均值为零、方差为2,普通IID平均理论恢复适用。这个反例用来定位数据复用风险,不建议采用这种学习器。
推论与应用
用各条样本外得分 ϕ ^ i 构造 σ ^ 2 = n − 1 ∑ i ( ϕ ^ i − μ ^ ) 2 。逐折条件化先给 P n , k h k 2 = o P ( 1 ) ,再由 Cauchy–Schwarz 控制真实与拟合得分平方之差,结合真实得分的大数律 理路 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 得到 σ ^ 2 → P σ 2 ;标准误为 σ ^ / n 。四行算例的经验方差为 31 / 2 ,标准误为 31 / 8 ,只是一项可复算输出,不是四个样本已经支持名义覆盖的证据。
交叉拟合不能修复缺失不随机、缺乏观察概率下界或错误的目标定义。若有家庭等相关单元,应按独立单元分折;随机拆散同一家庭的行可能重新引入依赖。重复很多次分折并挑最显著结果,也超出了预先固定协议的保证。
自测与答案
两个 nuisance 误差分别为 O P ( n − 0.30 ) 和 O P ( n − 0.25 ) ,乘积条件是否足够?答案:乘积为 O P ( n − 0.55 ) = o P ( n − 1 / 2 ) ,足够;两者都只有 O P ( n − 1 / 4 ) 则仅得到大 O P ( n − 1 / 2 ) ,不足以由这条界排除一阶偏差。
五折拟合是否让五个折均值独立?答案:不。训练集彼此大量重叠;证明逐折条件化,然后利用固定有限项相加,不采用折间独立性。
参考资料