形式陈述
在线性回归模型 公理库 线性回归统计模型 Linear regression model · Linear model 响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。 中,观察 Y = X β 0 + ε ,其中 X ∈ R n × p ,β 0 ∈ R p 为真实系数。本页直接使用给定设计矩阵,不另加截距;如模型需要截距或中心化,应在设计与惩罚方式中预先规定。记样本 Gram 矩阵为 Γ = X T X / n ,用归一化平方损失定义初始估计
β ^ ∈ arg min β ∈ R p { ‖ Y − X β ‖ 2 2 2 n + λ ‖ β ‖ 1 } , λ > 0. Lasso 最优性与对偶间隙 公理库 Lasso 的最优性与对偶间隙 Lasso optimality conditions · Lasso duality gap · Lasso primal-dual certificate 从残差相关性核验 Lasso 的零与非零坐标,并用可行对偶值认证剩余优化误差。 使用未除以样本数的平方损失。将这里的目标乘以 n ,可见同一个解对应那里的惩罚参数 λ o l d = n λ 。本页的最优性条件因此是 X T ( Y − X β ^ ) / n = λ s ^ ,其中非零坐标满足 s ^ j = sign ( β ^ j ) ,零坐标满足 | s ^ j | ≤ 1 。
取 M ∈ R p × p ,它可以固定,也可以可测地仅由 X 构造。去偏估计定义为
b = β ^ + 1 n M X T ( Y − X β ^ ) . 记 M 的第 j 行为 m j T ,e j 为第 j 个标准基向量,并定义
δ j = ‖ e j T − m j T Γ ‖ ∞ , L = ‖ β ^ − β 0 ‖ 1 , v j = m j T Γ m j . δ j 衡量修正方向距离一个真正的逆矩阵行有多远;L 衡量初始系数估计的总绝对误差;v j 决定修正后噪声的方差。三者承担不同角色。核心恒等式及其坐标余项界为
b − β 0 = 1 n M X T ε + R , R = ( I − M Γ ) ( β ^ − β 0 ) , | R j | ≤ δ j L . 进一步假设联合正态噪声 公理库 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ε ∣ X ∼ N n ( 0 , σ 2 I n ) ,σ > 0 ,且所研究坐标满足 v j > 0 。沿样本量增长的一列模型,p 和设计可以随 n 改变。对预先指定的一个坐标,如果
n δ j L σ v j → P 0 , σ ^ σ → P 1 , 其中 σ ^ > 0 是噪声标准差估计,则有
n ( b j − β j 0 ) σ ^ v j → d N ( 0 , 1 ) . 因此,对固定 0 < α < 1 ,记 z 1 − α / 2 为标准正态分位数,区间
[ b j − z 1 − α / 2 σ ^ v j n , b j + z 1 − α / 2 σ ^ v j n ] 具有趋于 1 − α 的覆盖概率。这里直接给出需要验证的乘积条件;它把不同设计、初始估计和修正矩阵的分析归结到同一个接口。
直觉
用残差得分补回收缩
Lasso 的惩罚将系数向零收缩,便于利用稀疏结构,但这种收缩也进入坐标估计误差。最优点的残差得分通常为 λ s ^ ,而不是零。去偏步骤读取这个尚未消失的得分,再用 M 把响应方向的残差相关性转换为系数方向的修正。即使初始估计包含许多零坐标,修正后的 b 也通常不再稀疏:它的目标是推断一个系数,而非保留变量筛选结果。
若 Γ 可逆,选 M = Γ − 1 就能完全消去初始估计误差。高维情况下 p > n ,Γ 必然奇异,因此需要放宽为只让所需行近似实现逆矩阵的作用。近似误差无需对所有可能的系数方向都很小;它与当前估计误差相乘后的坐标影响,才是区间能否校准的关键。
一步修正的精确分解
把模型代入残差,有
Y − X β ^ = ε − X ( β ^ − β 0 ) . 继续代入去偏定义,逐项整理得
b − β 0 = ( β ^ − β 0 ) + 1 n M X T ε − M X T X n ( β ^ − β 0 ) = 1 n M X T ε + ( I − M Γ ) ( β ^ − β 0 ) . 这一步纯属代数,对任何初始向量和任何 M 都成立,不依赖 Lasso 是否精确求解。Lasso 的作用是提供一个可能具有良好统计误差界的初始估计;求解误差若没有忽略,也已经包含在 L 中。
写 a T = e j T − m j T Γ 、h = β ^ − β 0 ,逐项取绝对值便得到
| R j | = | ∑ k = 1 p a k h k | ≤ ∑ k = 1 p | a k | | h k | ≤ ( max k | a k | ) ∑ k = 1 p | h k | = δ j L . 这是有限维 Hölder 不等式 公理库 Hölder 不等式 Hölder's inequality 共轭指数下函数乘积的 L¹ 范数由各自的 Lᵖ 范数乘积控制。 的 ℓ ∞ –ℓ 1 配对。它展示了两个改进方向:更准确的初始估计缩小 L ,更准确的逆矩阵行缩小 δ j 。即便其中一个量单独不够快,乘积仍可能小于该坐标的随机标准误。
正态的是线性主项
条件于 X 后,M 也固定。在上述正态噪声假设下,联合正态向量的线性变换给出
1 n M X T ε | X ∼ N p ( 0 , σ 2 n M Γ M T ) . 于是
Z j = m j T X T ε σ n v j | X ∼ N ( 0 , 1 ) , T j = n ( b j − β j 0 ) σ v j = Z j + Δ j , | Δ j | ≤ n δ j L σ v j . 对随机设计,条件分布始终是同一个标准正态,故积分后 Z j 的无条件分布也精确标准正态。余项 Δ j 使用同一份数据,通常与 Z j 相关;下面的概率证明只控制其大小,不要求两者独立。
例子与边界
相关列如何把残差带到另一个坐标
用一个无噪声代数算例看清修正方向。取 n = 3 , p = 2 ,设计的两列为
X 1 = 3 ( 1 0 0 ) , X 2 = 3 ( 1 / 2 3 / 2 0 ) , Γ = ( 1 1 / 2 1 / 2 1 ) . 设 β 0 = ( 1 , 0 ) T 、Y = X β 0 、λ = 1 / 4 。候选 β ^ = ( 3 / 4 , 0 ) T 的残差是 X 1 / 4 ,故
X T ( Y − X β ^ ) n = 1 4 Γ e 1 = ( 1 / 4 1 / 8 ) . 第一坐标为正,得分恰为 λ ;第二坐标为零,得分绝对值 1 / 8 ≤ λ 。两条 KKT 条件均成立,且 Γ 的特征值为 3 / 2 , 1 / 2 ,平方损失严格凸,因此这是唯一 Lasso 解。
先取 M = I ,直接加回得分,得到
b = ( 3 / 4 0 ) + ( 1 / 4 1 / 8 ) = ( 1 1 / 8 ) . 第一坐标收缩被补回,第二坐标却出现 1 / 8 。原因是两列的相关性为 1 / 2 :沿第一列的残差也与第二列相关,单位矩阵没有把两者拆开。恒等式在这里给出
R = ( I − Γ ) ( − 1 / 4 0 ) = ( 0 1 / 8 ) . 第二行的缺陷为 δ 2 = 1 / 2 ,初始误差为 L = 1 / 4 ,所以 | R 2 | = δ 2 L = 1 / 8 。乘积界在这个坐标恰好取等号。
改取真正的逆矩阵,
M = Γ − 1 = ( 4 / 3 − 2 / 3 − 2 / 3 4 / 3 ) , 得分的第一坐标修正为 ( 4 / 3 ) ( 1 / 4 ) − ( 2 / 3 ) ( 1 / 8 ) = 1 / 4 ,第二坐标修正为 − ( 2 / 3 ) ( 1 / 4 ) + ( 4 / 3 ) ( 1 / 8 ) = 0 。因此 b = ( 1 , 0 ) T ,两坐标都回到真值。
精确消除余项与方差代价
上面的 Y = X β 0 用于逐项核验代数。现在保留同一个设计,让 Y 按正态噪声模型重新采样;去偏定义对每次采样都给出
b = β ^ + Γ − 1 ( X T Y n − Γ β ^ ) = Γ − 1 X T Y n = ( X T X ) − 1 X T Y . 所以在满列秩设计中,精确逆修正就是普通最小二乘,与起点的具体 Lasso 解无关。它的条件协方差为 σ 2 Γ − 1 / n :两个坐标的方差均为 4 σ 2 / ( 3 n ) ,协方差为 − 2 σ 2 / ( 3 n ) 。本例 n = 3 ,分别为 4 σ 2 / 9 与 − 2 σ 2 / 9 。相较于相同列范数、正交设计的 σ 2 / n ,列相关性提高了每个系数的估计方差。
完全相同的列留下不可消除的缺陷
再考虑两个完全相同、平方范数均为 n 的列,此时
Γ = ( 1 1 1 1 ) . 任取 m = ( u , v ) T ,有 Γ m = ( a , a ) T ,其中 a = u + v 。要近似第一坐标方向 e 1 ,最小可能缺陷是
inf m ‖ Γ m − e 1 ‖ ∞ = inf a ∈ R max { | a − 1 | , | a | } = 1 2 . 下界来自 1 ≤ | a − 1 | + | a | ≤ 2 max { | a − 1 | , | a | } ;取 a = 1 / 2 就达到下界。因而这个设计根本不存在缺陷小于 1 / 2 的修正方向。
统计障碍同样直接:β 0 = ( 1 , 0 ) T 与 β 0 = ( 0 , 1 ) T 都只有一个非零坐标,却给出完全相同的 X β 0 ;配上同一个噪声分布,全部观测的分布相同。两种参数的第一坐标不同,故仅凭这些观测无法区分它们,稀疏性本身不能识别第一坐标。可识别的是两个系数的和。
推论与应用
从余项界得到有限样本分布界
固定 η > 0 、0 ≤ τ ≤ 1 ,假设已证明
Pr { n δ j L σ v j > η } ≤ τ . 令 E 表示大括号中那个量不超过 η 的好事件,则 Pr ( E c ) ≤ τ ,并且在 E 上有 | T j − Z j | ≤ η 。对任意实数 t ,成立以下事件包含关系:
{ Z j ≤ t − η } ∩ E ⊆ { T j ≤ t } , { T j ≤ t } ∩ E ⊆ { Z j ≤ t + η } . 第一条说主项即使向右移动 η 也不会越过 t ;第二条说总量已经不超过 t 时,主项最多比它大 η 。取概率,只在移除好事件时损失至多 τ ,得到
Φ ( t − η ) − τ ≤ Pr ( T j ≤ t ) ≤ Φ ( t + η ) + τ . 标准正态密度处处不超过 1 / 2 π ,所以长度为 η 的区间概率至多为 η / 2 π 。于是整个分布函数与标准正态之间的最大差满足
sup t ∈ R | Pr ( T j ≤ t ) − Φ ( t ) | ≤ η 2 π + τ . 同一好事件还能直接控制双侧区间。记 c = z 1 − α / 2 、G ( u ) = Pr ( | Z j | ≤ u ) ,约定 u < 0 时 G ( u ) = 0 。由 | | T j | − | Z j | | ≤ η 可得
G ( c − η ) − τ ≤ Pr ( | T j | ≤ c ) ≤ G ( c + η ) + τ . G 的变化率至多为 2 / 2 π ,而 G ( c ) = 1 − α ,因此已知 σ 的正态区间满足
| Pr { β j 0 ∈ [ b j − c σ v j / n , b j + c σ v j / n ] } − ( 1 − α ) | ≤ 2 η 2 π + τ . 这里坏事件只计一次,因为同时控制两端使用的是同一个 E 。整个论证没有使用主项与余项的独立性。对随机设计,上述概率默认对完整数据取值;若要逐个设计给出条件覆盖界,则须相应控制 Pr ( E c ∣ X ) 。
用 Slutsky 定理替换噪声尺度
若形式陈述中的标准化乘积依概率趋零,则 Δ j → P 0 。每个 n 的 Z j 都服从标准正态,所以 Slutsky 定理 公理库 Slutsky 定理 Slutsky's theorem 依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。 先给出 T j = Z j + Δ j → d N ( 0 , 1 ) ,再给出
n ( b j − β j 0 ) σ ^ v j = T j σ ^ / σ → d N ( 0 , 1 ) . 标准正态在 ± c 没有概率质量,故标准化统计量落在 [ − c , c ] 的概率趋于 1 − α ,这就完成了坐标区间的证明。σ ^ 与 b j 可以来自同一数据;所需的是比值一致性。上面的有限样本界则使用已知 σ ,若希望连同尺度估计一起获得定量覆盖误差,还需要对尺度比值的偏离给出概率界。
如何选择修正方向
一种直接构造逐坐标求解
minimize m ∈ R p m T Γ m subject to ‖ Γ m − e j ‖ ∞ ≤ μ , 其中 μ ≥ 0 是允许的逆矩阵缺陷。这是 Javanmard 与 Montanari 所研究的构造:目标控制高斯主项的方差,约束确保 δ j ≤ μ ,因为 Γ 对称。Γ 半正定,目标为凸二次函数,约束是凸集;但给定设计与 μ 后仍须确认可行性。完全相同列的例子已经说明,任意缩小 μ 可能使问题无解。
更小的可行域倾向于要求更精确的逆作用,而更大的可行域容许降低方差;选择时必须结合 L 的控制来判断乘积余项。v j 本身也要正,标准化才有意义。另一条常见路径是逐列回归的 nodewise Lasso,用一列对其余列的残差构造修正方向;van de Geer 的讲义给出了这种构造及相应余项分析。
实际应用中,δ j 和 v j 可由设计与修正矩阵计算,L 含未知真参数,需要由模型假设下的统计理论控制。设计的可识别结构、列尺度、真实支持大小和惩罚选择会共同影响这个控制。对偶间隙可以认证 Lasso 优化是否充分完成,却不能独自认证 L 足够小;完成修正优化也只解决了缺陷与方差的取舍。
“去偏”指一阶收缩影响被修正,并不声称所有有限样本下 E [ b j ] = β j 0 。这里的结论是预先指定坐标的区间覆盖;若从很多坐标中挑出最大的结果再报告,或要求所有坐标同时覆盖,需要另行校准联合误差。
正态主项的简单公式也有明确适用范围:若 M 依赖 Y ,条件于 X 后它仍随机,便不能直接当作固定矩阵变换正态噪声;若噪声条件协方差为 Ω ,线性主项的协方差应改成 M X T Ω X M T / n 2 。非正态噪声下可以另行研究正态近似,但本页的精确条件正态论证不再直接适用。
参考资料