形式陈述
在线性回归模型公理库线性回归统计模型Linear regression model · Linear model响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。中,观察 ,其中 , 为真实系数。本页直接使用给定设计矩阵,不另加截距;如模型需要截距或中心化,应在设计与惩罚方式中预先规定。记样本 Gram 矩阵为 ,用归一化平方损失定义初始估计
Lasso 最优性与对偶间隙公理库Lasso 的最优性与对偶间隙Lasso optimality conditions · Lasso duality gap · Lasso primal-dual certificate从残差相关性核验 Lasso 的零与非零坐标,并用可行对偶值认证剩余优化误差。使用未除以样本数的平方损失。将这里的目标乘以 ,可见同一个解对应那里的惩罚参数 。本页的最优性条件因此是 ,其中非零坐标满足 ,零坐标满足 。
取 ,它可以固定,也可以仅由 构造。去偏估计定义为
记 的第 行为 , 为第 个标准基向量,并定义
衡量修正方向距离一个真正的逆矩阵行有多远; 衡量初始系数估计的总绝对误差; 决定修正后噪声的方差。三者承担不同角色。核心恒等式及其坐标余项界为
进一步假设 ,,且所研究坐标满足 。沿样本量增长的一列模型, 和设计可以随 改变。对预先指定的一个坐标,如果
其中 是噪声标准差估计,则有
因此,对固定 ,记 为标准正态分位数,区间
具有趋于 的覆盖概率。这里直接给出需要验证的乘积条件;它把不同设计、初始估计和修正矩阵的分析归结到同一个接口。
直觉
用残差得分补回收缩
Lasso 的惩罚将系数向零收缩,便于利用稀疏结构,但这种收缩也进入坐标估计误差。最优点的残差得分通常为 ,而不是零。去偏步骤读取这个尚未消失的得分,再用 把响应方向的残差相关性转换为系数方向的修正。即使初始估计包含许多零坐标,修正后的 也通常不再稀疏:它的目标是推断一个系数,而非保留变量筛选结果。
若 可逆,选 就能完全消去初始估计误差。高维情况下 , 必然奇异,因此需要放宽为只让所需行近似实现逆矩阵的作用。近似误差无需对所有可能的系数方向都很小;它与当前估计误差相乘后的坐标影响,才是区间能否校准的关键。
一步修正的精确分解
把模型代入残差,有
继续代入去偏定义,逐项整理得
这一步纯属代数,对任何初始向量和任何 都成立,不依赖 Lasso 是否精确求解。Lasso 的作用是提供一个可能具有良好统计误差界的初始估计;求解误差若没有忽略,也已经包含在 中。
写 、,逐项取绝对值便得到
这是有限维 Hölder 不等式公理库Hölder 不等式Hölder's inequality共轭指数下函数乘积的 L¹ 范数由各自的 Lᵖ 范数乘积控制。的 – 配对。它展示了两个改进方向:更准确的初始估计缩小 ,更准确的逆矩阵行缩小 。即便其中一个量单独不够快,乘积仍可能小于该坐标的随机标准误。
正态的是线性主项
条件于 后, 也固定。在上述正态噪声假设下,正态向量的线性变换公理库正态分布Normal distribution · Gaussian distribution · 高斯分布具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。给出
于是
对随机设计,条件分布始终是同一个标准正态,故积分后 的无条件分布也精确标准正态。余项 使用同一份数据,通常与 相关;下面的概率证明只控制其大小,不要求两者独立。
例子与边界
相关列如何把残差带到另一个坐标
用一个无噪声代数算例看清修正方向。取 ,设计的两列为
设 、、。候选 的残差是 ,故
第一坐标为正,得分恰为 ;第二坐标为零,得分绝对值 。两条 KKT 条件均成立,且 的特征值为 ,平方损失严格凸,因此这是唯一 Lasso 解。
先取 ,直接加回得分,得到
第一坐标收缩被补回,第二坐标却出现 。原因是两列的相关性为 :沿第一列的残差也与第二列相关,单位矩阵没有把两者拆开。恒等式在这里给出
第二行的缺陷为 ,初始误差为 ,所以 。乘积界在这个坐标恰好取等号。
改取真正的逆矩阵,
得分的第一坐标修正为 ,第二坐标修正为 。因此 ,两坐标都回到真值。
精确消除余项与方差代价
上面的 用于逐项核验代数。现在保留同一个设计,让 按正态噪声模型重新采样;去偏定义对每次采样都给出
所以在满列秩设计中,精确逆修正就是普通最小二乘,与起点的具体 Lasso 解无关。它的条件协方差为 :两个坐标的方差均为 ,协方差为 。本例 ,分别为 与 。相较于相同列范数、正交设计的 ,列相关性提高了每个系数的估计方差。
完全相同的列留下不可消除的缺陷
再考虑两个完全相同、平方范数均为 的列,此时
任取 ,有 ,其中 。要近似第一坐标方向 ,最小可能缺陷是
下界来自 ;取 就达到下界。因而这个设计根本不存在缺陷小于 的修正方向。
统计障碍同样直接: 与 都只有一个非零坐标,却给出完全相同的 ;配上同一个噪声分布,全部观测的分布相同。两种参数的第一坐标不同,故仅凭这些观测无法区分它们,稀疏性本身不能识别第一坐标。可识别的是两个系数的和。
推论与应用
从余项界得到有限样本分布界
固定 、,假设已证明
令 表示大括号中那个量不超过 的好事件,则 ,并且在 上有 。对任意实数 ,成立以下事件包含关系:
第一条说主项即使向右移动 也不会越过 ;第二条说总量已经不超过 时,主项最多比它大 。取概率,只在移除好事件时损失至多 ,得到
标准正态密度处处不超过 ,所以长度为 的区间概率至多为 。于是整个分布函数与标准正态之间的最大差满足
同一好事件还能直接控制双侧区间。记 、,约定 时 。由 可得
的变化率至多为 ,而 ,因此已知 的正态区间满足
这里坏事件只计一次,因为同时控制两端使用的是同一个 。整个论证没有使用主项与余项的独立性。对随机设计,上述概率默认对完整数据取值;若要逐个设计给出条件覆盖界,则须相应控制 。
用 Slutsky 定理替换噪声尺度
若形式陈述中的标准化乘积依概率趋零,则 。每个 的 都服从标准正态,所以 Slutsky 定理公理库Slutsky 定理Slutsky's theorem依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。先给出 ,再给出
标准正态在 没有概率质量,故标准化统计量落在 的概率趋于 ,这就完成了坐标区间的证明。 与 可以来自同一数据;所需的是比值一致性。上面的有限样本界则使用已知 ,若希望连同尺度估计一起获得定量覆盖误差,还需要对尺度比值的偏离给出概率界。
如何选择修正方向
一种直接构造逐坐标求解
其中 是允许的逆矩阵缺陷。这是 Javanmard 与 Montanari 所研究的构造:目标控制高斯主项的方差,约束确保 ,因为 对称。 半正定,目标为凸二次函数,约束是凸集;但给定设计与 后仍须确认可行性。完全相同列的例子已经说明,任意缩小 可能使问题无解。
更小的可行域倾向于要求更精确的逆作用,而更大的可行域容许降低方差;选择时必须结合 的控制来判断乘积余项。 本身也要正,标准化才有意义。另一条常见路径是逐列回归的 nodewise Lasso,用一列对其余列的残差构造修正方向;van de Geer 的讲义给出了这种构造及相应余项分析。
实际应用中, 和 可由设计与修正矩阵计算, 含未知真参数,需要由模型假设下的统计理论控制。设计的可识别结构、列尺度、真实支持大小和惩罚选择会共同影响这个控制。对偶间隙可以认证 Lasso 优化是否充分完成,却不能独自认证 足够小;完成修正优化也只解决了缺陷与方差的取舍。
“去偏”指一阶收缩影响被修正,并不声称所有有限样本下 。这里的结论是预先指定坐标的区间覆盖;若从很多坐标中挑出最大的结果再报告,或要求所有坐标同时覆盖,需要另行校准联合误差。
正态主项的简单公式也有明确适用范围:若 依赖 ,条件于 后它仍随机,便不能直接当作固定矩阵变换正态噪声;若噪声条件协方差为 ,线性主项的协方差应改成 。非正态噪声下可以另行研究正态近似,但本页的精确条件正态论证不再直接适用。
参考资料