Skip to content

方法Method

去偏 Lasso 与坐标置信区间

Debiased Lasso · de-biased Lasso · de-sparsified Lasso · desparsified Lasso · 去稀疏 Lasso

用近似逆矩阵修正 Lasso 的残差得分,将坐标误差拆成高斯主项与可控制的乘积余项,并据此构造置信区间。

形式陈述 ​

在线性回归模型中,观察 Y=Xβ0+ε,其中 X∈Rn×p,β0∈Rp 为真实系数。本页直接使用给定设计矩阵,不另加截距;如模型需要截距或中心化,应在设计与惩罚方式中预先规定。记样本 Gram 矩阵为 Γ=XTX/n,用归一化平方损失定义初始估计

β^∈argminβ∈Rp{‖Y−Xβ‖222n+λ‖β‖1},λ>0.

Lasso 最优性与对偶间隙使用未除以样本数的平方损失。将这里的目标乘以 n,可见同一个解对应那里的惩罚参数 λold=nλ。本页的最优性条件因此是 XT(Y−Xβ^)/n=λs^,其中非零坐标满足 s^j=sign(β^j),零坐标满足 |s^j|≤1。

取 M∈Rp×p,它可以固定,也可以仅由 X 构造。去偏估计定义为

b=β^+1nMXT(Y−Xβ^).

记 M 的第 j 行为 mjT,ej 为第 j 个标准基向量,并定义

δj=‖ejT−mjTΓ‖∞,L=‖β^−β0‖1,vj=mjTΓmj.

δj 衡量修正方向距离一个真正的逆矩阵行有多远;L 衡量初始系数估计的总绝对误差;vj 决定修正后噪声的方差。三者承担不同角色。核心恒等式及其坐标余项界为

b−β0=1nMXTε+R,R=(I−MΓ)(β^−β0),|Rj|≤δjL.

进一步假设 ε∣X∼Nn(0,σ2In),σ>0,且所研究坐标满足 vj>0。沿样本量增长的一列模型,p 和设计可以随 n 改变。对预先指定的一个坐标,如果

nδjLσvj→P0,σ^σ→P1,

其中 σ^>0 是噪声标准差估计,则有

n(bj−βj0)σ^vj→dN(0,1).

因此,对固定 0<α<1,记 z1−α/2 为标准正态分位数,区间

[bj−z1−α/2σ^vjn,bj+z1−α/2σ^vjn]

具有趋于 1−α 的覆盖概率。这里直接给出需要验证的乘积条件;它把不同设计、初始估计和修正矩阵的分析归结到同一个接口。

直觉

用残差得分补回收缩 ​

Lasso 的惩罚将系数向零收缩,便于利用稀疏结构,但这种收缩也进入坐标估计误差。最优点的残差得分通常为 λs^,而不是零。去偏步骤读取这个尚未消失的得分,再用 M 把响应方向的残差相关性转换为系数方向的修正。即使初始估计包含许多零坐标,修正后的 b 也通常不再稀疏:它的目标是推断一个系数,而非保留变量筛选结果。

若 Γ 可逆,选 M=Γ−1 就能完全消去初始估计误差。高维情况下 p>n,Γ 必然奇异,因此需要放宽为只让所需行近似实现逆矩阵的作用。近似误差无需对所有可能的系数方向都很小;它与当前估计误差相乘后的坐标影响,才是区间能否校准的关键。

一步修正的精确分解 ​

把模型代入残差,有

Y−Xβ^=ε−X(β^−β0).

继续代入去偏定义,逐项整理得

b−β0=(β^−β0)+1nMXTε−MXTXn(β^−β0)=1nMXTε+(I−MΓ)(β^−β0).

这一步纯属代数,对任何初始向量和任何 M 都成立,不依赖 Lasso 是否精确求解。Lasso 的作用是提供一个可能具有良好统计误差界的初始估计;求解误差若没有忽略,也已经包含在 L 中。

写 aT=ejT−mjTΓ、h=β^−β0,逐项取绝对值便得到

|Rj|=|∑k=1pakhk|≤∑k=1p|ak||hk|≤(maxk|ak|)∑k=1p|hk|=δjL.

这是有限维 Hölder 不等式的 ℓ∞–ℓ1 配对。它展示了两个改进方向:更准确的初始估计缩小 L,更准确的逆矩阵行缩小 δj。即便其中一个量单独不够快,乘积仍可能小于该坐标的随机标准误。

正态的是线性主项 ​

条件于 X 后,M 也固定。在上述正态噪声假设下,正态向量的线性变换给出

1nMXTε | X∼Np(0,σ2nMΓMT).

于是

Zj=mjTXTεσnvj | X∼N(0,1),Tj=n(bj−βj0)σvj=Zj+Δj,|Δj|≤nδjLσvj.

对随机设计,条件分布始终是同一个标准正态,故积分后 Zj 的无条件分布也精确标准正态。余项 Δj 使用同一份数据,通常与 Zj 相关;下面的概率证明只控制其大小,不要求两者独立。

例子与边界

相关列如何把残差带到另一个坐标 ​

用一个无噪声代数算例看清修正方向。取 n=3,p=2,设计的两列为

X1=3(100),X2=3(1/23/20),Γ=(11/21/21).

设 β0=(1,0)T、Y=Xβ0、λ=1/4。候选 β^=(3/4,0)T 的残差是 X1/4,故

XT(Y−Xβ^)n=14Γe1=(1/41/8).

第一坐标为正,得分恰为 λ;第二坐标为零,得分绝对值 1/8≤λ。两条 KKT 条件均成立,且 Γ 的特征值为 3/2,1/2,平方损失严格凸,因此这是唯一 Lasso 解。

先取 M=I,直接加回得分,得到

b=(3/40)+(1/41/8)=(11/8).

第一坐标收缩被补回,第二坐标却出现 1/8。原因是两列的相关性为 1/2:沿第一列的残差也与第二列相关,单位矩阵没有把两者拆开。恒等式在这里给出

R=(I−Γ)(−1/40)=(01/8).

第二行的缺陷为 δ2=1/2,初始误差为 L=1/4,所以 |R2|=δ2L=1/8。乘积界在这个坐标恰好取等号。

改取真正的逆矩阵,

M=Γ−1=(4/3−2/3−2/34/3),

得分的第一坐标修正为 (4/3)(1/4)−(2/3)(1/8)=1/4,第二坐标修正为 −(2/3)(1/4)+(4/3)(1/8)=0。因此 b=(1,0)T,两坐标都回到真值。

精确消除余项与方差代价 ​

上面的 Y=Xβ0 用于逐项核验代数。现在保留同一个设计,让 Y 按正态噪声模型重新采样;去偏定义对每次采样都给出

b=β^+Γ−1(XTYn−Γβ^)=Γ−1XTYn=(XTX)−1XTY.

所以在满列秩设计中,精确逆修正就是普通最小二乘,与起点的具体 Lasso 解无关。它的条件协方差为 σ2Γ−1/n:两个坐标的方差均为 4σ2/(3n),协方差为 −2σ2/(3n)。本例 n=3,分别为 4σ2/9 与 −2σ2/9。相较于相同列范数、正交设计的 σ2/n,列相关性提高了每个系数的估计方差。

完全相同的列留下不可消除的缺陷 ​

再考虑两个完全相同、平方范数均为 n 的列,此时

Γ=(1111).

任取 m=(u,v)T,有 Γm=(a,a)T,其中 a=u+v。要近似第一坐标方向 e1,最小可能缺陷是

infm‖Γm−e1‖∞=infa∈Rmax{|a−1|,|a|}=12.

下界来自 1≤|a−1|+|a|≤2max{|a−1|,|a|};取 a=1/2 就达到下界。因而这个设计根本不存在缺陷小于 1/2 的修正方向。

统计障碍同样直接:β0=(1,0)T 与 β0=(0,1)T 都只有一个非零坐标,却给出完全相同的 Xβ0;配上同一个噪声分布,全部观测的分布相同。两种参数的第一坐标不同,故仅凭这些观测无法区分它们,稀疏性本身不能识别第一坐标。可识别的是两个系数的和。

推论与应用

从余项界得到有限样本分布界 ​

固定 η>0、0≤τ≤1,假设已证明

Pr{nδjLσvj>η}≤τ.

令 E 表示大括号中那个量不超过 η 的好事件,则 Pr(Ec)≤τ,并且在 E 上有 |Tj−Zj|≤η。对任意实数 t,成立以下事件包含关系:

{Zj≤t−η}∩E⊆{Tj≤t},{Tj≤t}∩E⊆{Zj≤t+η}.

第一条说主项即使向右移动 η 也不会越过 t;第二条说总量已经不超过 t 时,主项最多比它大 η。取概率,只在移除好事件时损失至多 τ,得到

Φ(t−η)−τ≤Pr(Tj≤t)≤Φ(t+η)+τ.

标准正态密度处处不超过 1/2π,所以长度为 η 的区间概率至多为 η/2π。于是整个分布函数与标准正态之间的最大差满足

supt∈R|Pr(Tj≤t)−Φ(t)|≤η2π+τ.

同一好事件还能直接控制双侧区间。记 c=z1−α/2、G(u)=Pr(|Zj|≤u),约定 u<0 时 G(u)=0。由 ||Tj|−|Zj||≤η 可得

G(c−η)−τ≤Pr(|Tj|≤c)≤G(c+η)+τ.

G 的变化率至多为 2/2π,而 G(c)=1−α,因此已知 σ 的正态区间满足

|Pr{βj0∈[bj−cσvj/n, bj+cσvj/n]}−(1−α)|≤2η2π+τ.

这里坏事件只计一次,因为同时控制两端使用的是同一个 E。整个论证没有使用主项与余项的独立性。对随机设计,上述概率默认对完整数据取值;若要逐个设计给出条件覆盖界,则须相应控制 Pr(Ec∣X)。

用 Slutsky 定理替换噪声尺度 ​

若形式陈述中的标准化乘积依概率趋零,则 Δj→P0。每个 n 的 Zj 都服从标准正态,所以 Slutsky 定理先给出 Tj=Zj+Δj→dN(0,1),再给出

n(bj−βj0)σ^vj=Tjσ^/σ→dN(0,1).

标准正态在 ±c 没有概率质量,故标准化统计量落在 [−c,c] 的概率趋于 1−α,这就完成了坐标区间的证明。σ^ 与 bj 可以来自同一数据;所需的是比值一致性。上面的有限样本界则使用已知 σ,若希望连同尺度估计一起获得定量覆盖误差,还需要对尺度比值的偏离给出概率界。

如何选择修正方向 ​

一种直接构造逐坐标求解

minimizem∈Rp mTΓmsubject to‖Γm−ej‖∞≤μ,

其中 μ≥0 是允许的逆矩阵缺陷。这是 Javanmard 与 Montanari 所研究的构造:目标控制高斯主项的方差,约束确保 δj≤μ,因为 Γ 对称。Γ 半正定,目标为凸二次函数,约束是凸集;但给定设计与 μ 后仍须确认可行性。完全相同列的例子已经说明,任意缩小 μ 可能使问题无解。

更小的可行域倾向于要求更精确的逆作用,而更大的可行域容许降低方差;选择时必须结合 L 的控制来判断乘积余项。vj 本身也要正,标准化才有意义。另一条常见路径是逐列回归的 nodewise Lasso,用一列对其余列的残差构造修正方向;van de Geer 的讲义给出了这种构造及相应余项分析。

实际应用中,δj 和 vj 可由设计与修正矩阵计算,L 含未知真参数,需要由模型假设下的统计理论控制。设计的可识别结构、列尺度、真实支持大小和惩罚选择会共同影响这个控制。对偶间隙可以认证 Lasso 优化是否充分完成,却不能独自认证 L 足够小;完成修正优化也只解决了缺陷与方差的取舍。

“去偏”指一阶收缩影响被修正,并不声称所有有限样本下 E[bj]=βj0。这里的结论是预先指定坐标的区间覆盖;若从很多坐标中挑出最大的结果再报告,或要求所有坐标同时覆盖,需要另行校准联合误差。

正态主项的简单公式也有明确适用范围:若 M 依赖 Y,条件于 X 后它仍随机,便不能直接当作固定矩阵变换正态噪声;若噪声条件协方差为 Ω,线性主项的协方差应改成 MXTΩXMT/n2。非正态噪声下可以另行研究正态近似,但本页的精确条件正态论证不再直接适用。

参考资料
  • Adel Javanmard and Andrea Montanari, Confidence Intervals and Hypothesis Testing for High-Dimensional Regression, JMLR 15, 2014, pp. 2869–2909。§2.1 的式 (7) 与 Theorem 6 介绍修正构造及误差分解;§3.1 的 Lemma 13 与 §3.2 的式 (32) 在特定设计与稀疏条件下控制余项。本页将推断终点表述为显式乘积条件,并给出相应事件包含证明。
  • Sara van de Geer, Statistical Theory for High-Dimensional Models, 2014,Ch. 2 §2.4,Theorems 2.4.1–2.4.2 与 Remark 2.4.1,印刷页 18–20。讲义通过 nodewise 构造讨论去稀疏估计、线性主项、余项以及噪声尺度替换。
关系图谱20 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系