正则化学习保证:预测、参数与支持
形式陈述
本页的终点是完成一份有条件、有数值、能说明迁移边界的学习保证。你将分别回答:训练目标离最优多远,原设计上的均值预测误差多大,真实系数是否可辨认,非零名单是否正确,以及再做一轮训练是否改善测试风险。
主线为优化间隙 理路 Lasso 的最优性与对偶间隙 Lasso optimality conditions · Lasso duality gap · Lasso primal-dual certificate 从残差相关性核验 Lasso 的零与非零坐标,并用可行对偶值认证剩余优化误差。 → 基本不等式 理路 Lasso 基本不等式与预测误差 Lasso basic inequality · Lasso prediction error bound 从带优化容差的目标比较推导预测界与松弛锥,分清噪声事件、稀疏结构、设计条件和可计算证书各自的作用。 → 受限设计 理路 受限特征值与稀疏可识别性 Restricted eigenvalue condition · Compatibility condition for Lasso · Lasso 兼容条件 在稀疏误差锥上定量比较预测与参数范数,精确定标兼容常数和受限特征值,并处理非零优化容差。 → 支持恢复 理路 Lasso 支持恢复与不可表示条件 Lasso support recovery · Lasso sign consistency · Lasso irrepresentable condition 用活动集上的显式候选和非活动集的严格对偶余量证明符号恢复,区分可识别性、参数小误差、变量筛选和坐标推断。 → 岭的风险账本 理路 核岭回归 kernel ridge regression · KRR · least-squares regularization network 用表示定理把 RKHS 平方损失正则化化为一个 Gram 线性系统。 → 有限时间谱过滤 理路 线性模型早停的谱过滤 Early stopping spectral filter · Finite-time Landweber regularization 对零初始化线性梯度下降推导有限时刻过滤因子和精确风险,并在已知信号半径与噪声方差时,不看响应地选择有限网格中的停止轮数。 。前三站把一个数值候选转成有条件的统计误差界;第四站检查变量名单;后两站用精确谱计算理解收缩与早停。
如果还不熟悉符号,先补矩阵乘法 理路 矩阵 Matrix 以有限行列集合为索引、取值于半环,并以中间指标求和定义乘法的函数。 、向量范数 理路 赋范向量空间 Normed vector space 带满足正定、齐次与三角不等式范数的向量空间。 、最小二乘 理路 最小二乘与正规方程 Least squares · Normal equations 将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。 和信号加噪声模型 理路 线性回归统计模型 Linear regression model · Linear model 响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。 。‖ h ‖ 1 是绝对值之和,‖ h ‖ 2 2 是平方之和,X h 是每个设计点因参数误差而改变的预测。谱部分再补奇异值分解 理路 奇异值分解 Singular value decomposition · SVD 任意有限维线性映射都可在正交规范基下表示为非负对角伸缩。 和偏差—方差分解 理路 偏差、方差与均方误差 Bias–variance decomposition · Mean squared error 平方损失下将点态估计风险精确拆成抽样波动与系统位移,并说明两者的权衡边界。 。没有必要先读完全部统计学习理论才开始下面的小矩阵计算。
坐标置信区间 理路 去偏 Lasso 与坐标置信区间 Debiased Lasso · de-biased Lasso · de-sparsified Lasso · desparsified Lasso · 去稀疏 Lasso 用近似逆矩阵修正 Lasso 的残差得分,将坐标误差拆成高斯主项与可控制的乘积余项,并据此构造置信区间。 是参数推断分支,选择后推断 理路 选择后推断与截断正态校准 Post-selection inference · Selective inference · 选择性推断 在同一观测先被筛选再用于推断时,按选择事件重算零分布,并由截断正态枢轴得到条件有效的检验和区间。 是报告规则分支。它们各自处理新的概率目标,不自动成为本页全部计算的前置。
直觉
同一份拟合可以有几种不同的成功。预测只看 X h ,参数误差看 h ,支持恢复则把每个坐标是否恰为零当作离散判断。重复列让前两者分离;很小的错误非零系数让后两者分离。
ridge 与早停的另一条分界是信号和噪声。继续接近训练响应会降低残差,却可能把更多噪声带进预测。把风险分成两项再相加,才能判断这一步究竟值不值得。
计算时保持三个定标不变:Lasso 用 ‖ Y − X β ‖ 2 / ( 2 n ) + λ ‖ β ‖ 1 ;岭用 ‖ Y − X β ‖ 2 / ( 2 n ) + ( λ / 2 ) ‖ β ‖ 2 2 ;早停对半平均平方损失用步长 η 。其他页面的损失若没有除以样本数,惩罚和步长必须一起换算。
例子与边界
任务一:把旧优化证书接过来
旧 Lasso 优化页的观测数为 n = 3 ,未归一化惩罚为 1 ,第二轮候选的可行 gap 是 G = 1 / 36 。
换成这里的半平均平方损失目标后,λ 和 δ 分别是多少?
这个 gap 能否单独证明候选的支持就是真实支持?
若算法只报告目标下降了 0.1 ,却没有下界,能否把 0.1 直接当作剩余优化误差?
任务二:一个可识别设计,分别回答三种误差
取 n = 3 , p = 2 ,
X 1 = 3 ( 1 , 0 , 0 ) T , X 2 = 3 ( 1 / 2 , 3 / 2 , 0 ) T , β 0 = ( 1 , 0 ) T , Y = X β 0 , λ = 1 / 4.
写出 Γ = X T X / n ,用 KKT 验证 β ^ = ( 3 / 4 , 0 ) ,说明唯一性
分别计算 q 2 = ‖ X ( β ^ − β 0 ) ‖ 2 2 / n 、ℓ 1 与 ℓ 2 参数误差、估计支持
对 S = { 1 } 、c = 3 算 κ 2 , ϕ 2 , α 2 ;代入误差界,区分实际误差与上界
用 M = I 2 和 M = Γ − 1 分别作一步去偏。若随后把模型改为 ε ∼ N 3 ( 0 , σ 2 I 3 ) 的 Gaussian 噪声,精确逆修正的两个坐标方差是多少?无噪声算例本身能否证明置信区间覆盖?
任务三:只改成重复列
保留任务二的第一列,令 X 2 = X 1 ,其余无噪声信号与 λ 不变。
求全部 Lasso 解,比较其中 ( 3 / 4 , 0 ) 与 ( 0 , 3 / 4 ) 的预测误差和系数误差
构造两个不同的一稀疏真参数,使全部观测分布相同。为什么任何算法都无法在这两个模型上同时可靠恢复支持?
算受限常数及第一坐标逆行的最小 ℓ ∞ 缺陷
若未来输入固定为 ( 1 , 0 ) ,原训练预测界能否通过某个有限 C 的 Σ ∗ ⪯ C Γ 迁移?
任务四:有曲率仍会选错,近似解还要另留预算
先取无噪声模型
Γ = ( 1 0 3 / 5 0 1 3 / 5 3 / 5 3 / 5 1 ) , β 0 = ( 1 , 1 , 0 ) T , λ = 1 / 10. 证明它全局正定,核验唯一解 ( 6 / 7 , 6 / 7 , 1 / 14 ) ,计算预测误差,并判断 λ ↓ 0 时原始支持是否恢复。再用已知 ℓ ∞ 误差上界 r = 1 / 7 检查阈值化规则 | β ^ j | > r 。
另取 Γ = I 2 、无噪声 β 0 = ( 1 , 0 ) 、λ = 1 / 10 。候选 ( 9 / 10 , 2 / 5 ) 的目标差是多少?它是否属于 C ( { 1 } , 3 ) ?用 ϕ 4 2 = 1 的带容差界算预测与 ℓ 1 上界,再与实际误差比较。令 0 < λ < 1 ,把系数写成 ( 1 − λ , 4 λ ) 后,优化 gap 趋零能否改变答案?
任务五:两个不同的迹与一次 GCV 误差
对
K = ( 1 1 / 2 1 / 2 1 ) , m = 2 , ρ = m λ = 1 / 2 , 令真实均值 μ = ( 1 , − 1 ) ,噪声均值零、协方差 σ 2 I 2 。
算 S = K ( K + ρ I ) − 1 的特征值、tr ( S ) 与 tr ( S 2 )
算均值预测风险、平均训练残差的期望及相同设计上独立新响应风险
改取 ρ = 1 、K = diag ( 9 , 1 / 9 ) 、y = ( 1 , 1 ) ,分别算固定 ρ 的精确 LOO 与 GCV
回到常数核 K = 1 1 T 、m = 2 、y = ( 1 , 0 ) 、平均损失惩罚 λ = 1 / 4 。删去第二点后,固定 ρ = 1 / 2 与固定 λ = 1 / 4 分别给什么预测?
任务六:训练还在下降,测试风险已经回升
固定
X = diag ( 2 , 1 / 5 ) , μ = ( 2 , 0 ) , σ 2 = 1 , η = 1 / 2 , 观察 Y = μ + ε ,其中 E ε = 0 、Cov ( ε ) = I 2 ;所说的新响应由同一模型独立重抽。从零开始对半平均平方损失做梯度下降。
算 t = 2 , 3 的两个过滤因子、偏差平方、方差及均值预测风险
算这两轮的期望训练目标,再换算同设计独立新响应的测试风险
第2轮要与 ridge 逐方向匹配,各自需要哪个 λ ?是否有同一个值?
如果读完同一训练路径再用独立验证集挑轮次,能否把所选随机 T 直接代入固定时刻风险公式?
给出执行 T 轮、只返回 β T 时的稠密计算成本与额外工作空间,说明 SVD 是否必需
可选题:在看标签前选停止轮数
保留任务六的设计,改为只知道 ‖ β 0 ‖ 2 2 ≤ 2 ,不再知道信号的方向。噪声的精确协方差为 I 2 ;候选轮数预定为 T = { 0 , 1 , … , 12 } ,并列时选较早轮数。
从固定时刻风险推出参数球上的精确最坏风险 U ( t ) ,说明为什么偏差项用最大值,而不是把各方向的最坏偏差相加
对 η = 1 / 2 选出停止轮数。写出包络、达到包络的真参数,并比较它与任务六具体信号的风险
把步长改成 η = 1 ,其余输入不变。重新选择轮数,不直接沿用第二轮;第一方向从第几轮起完全学到?t = 0 又如何定义?若再给 X 加一列全零特征,原设计预测证书与参数误差结论各有什么变化?
回到 η = 1 / 2 。若误用 R 2 = 1 而真参数为 2 v 2 ,第二轮报告的上界是否可靠?若误把实际噪声协方差 4 I 2 当成 I 2 ,原包络又在哪一项失效?若只知道一个次高斯上尺度,能否声称式(11)的等号?
明确上述极小极大结论究竟在哪些候选规则间成立。若把噪声方差换成同一标签计算的无偏估计,原证明能否原样使用?
可以用精确分数复算程序 核对全部候选;先写出风险模型与达到上界的参数,再与输出比较。
推论与应用
答案一:先统一目标,再谈统计条件
把旧目标整体除以三,得 λ = 1 / 3 、δ = G / 3 = 1 / 108 。目标的最优参数不变,但目标差也要同比例变化。
gap 只认证当前惩罚训练目标的次优量,不知道真参数或噪声,所以不能独自证明真实支持。一次下降 0.1 只比较两个候选;它没有给出距未知最优值的下界差,故也不是剩余优化误差证书。
答案二:可辨不意味着没有收缩
Γ = ( 1 1 / 2 1 / 2 1 ) ,最小特征值是 1 / 2 > 0 。候选残差 X 1 / 4 的得分是 ( 1 / 4 , 1 / 8 ) ,第一坐标匹配正号阈值,第二坐标严格在阈值内,所以候选最优;正定性给唯一性。
误差为 h = ( − 1 / 4 , 0 ) ,故 q 2 = 1 / 16 、‖ h ‖ 1 = ‖ h ‖ 2 = 1 / 4 ,支持是 { 1 } ,恰与真支持相同。三个结论分别回答预测、系数和非零名单,不能只报“恢复了”。
令 h = h 1 ( 1 , t ) 、| t | ≤ 3 。支持内分母下的最小二次式为 min ( 1 + t + t 2 ) = 3 / 4 ,在 t = − 1 / 2 取得;全向量分母下的最小值为 1 / 2 ,在 t = − 1 取得。因此 κ 2 = ϕ 2 = 3 / 4 、α 2 = 1 / 2 。相应界为 q 2 ≤ 3 / 4 、‖ h ‖ 1 ≤ 4 、‖ h ‖ 2 ≤ 3 / 2 。这些是保证上界,均不是本次实际误差。
单位修正得到 ( 3 / 4 , 0 ) + ( 1 / 4 , 1 / 8 ) = ( 1 , 1 / 8 ) 。精确逆
Γ − 1 = ( 4 / 3 − 2 / 3 − 2 / 3 4 / 3 )
则得到 ( 1 , 0 ) 。加上 Gaussian 噪声后,精确逆修正恒等于 OLS,协方差为 σ 2 Γ − 1 / 3 ,两个坐标方差都是 4 σ 2 / 9 ,协方差是 − 2 σ 2 / 9 。确定性的无噪声计算验证了代数,区间覆盖仍需要相应的噪声模型与尺度条件。
答案三:预测可用,坐标与支持不可辨
所有最优解为 ( a , 3 / 4 − a ) ,0 ≤ a ≤ 3 / 4 。两个端点都预测 3 X 1 / 4 ,故 q 2 = 1 / 16 。第一端点相对 β 0 = ( 1 , 0 ) 的 ℓ 1 与 ℓ 2 误差都是 1 / 4 ;第二端点的误差为 ( − 1 , 3 / 4 ) ,故分别为 7 / 4 与 5 / 4 。
真参数 ( 1 , 0 ) 与 ( 0 , 1 ) 的均值相同,再配同一噪声分布就有完全相同的观测分布。某算法输出支持 { 1 } 与 { 2 } 是互斥事件,在这个共同分布下二者概率之和至多一。因此至少一个真模型上的成功概率不超过 1 / 2 ,无法让两者都趋一。
向量 ( 1 , − 1 ) 位于误差锥且被 X 消去,所以三个受限常数都是零。任何逆行给 Γ m = ( a , a ) ,故
inf a max { | 1 − a | , | a | } = 1 / 2 ,在 a = 1 / 2 达到。这个缺陷不能靠更多优化迭代消除。
未来矩阵 Σ ∗ = diag ( 1 , 0 ) 在 v = ( 1 , − 1 ) 上给 v T Σ ∗ v = 1 ,而 v T Γ v = 0 。所以不存在有限 C 满足矩阵比较,原设计的预测保证不能这样迁移。
答案四:曲率控制大小,严格为零另需条件
三列设计的特征值是 1 和 1 ± 3 2 / 5 ,全部为正。由于
Γ − 1 1 = ( 10 / 7 , 10 / 7 , − 5 / 7 ) ,
候选 β 0 − λ Γ − 1 1 的三坐标为正、得分为 λ 1 ,满足全部 KKT,故为唯一解。
预测误差为 λ 2 1 T Γ − 1 1 = 3 / 140 。对每个 0 < λ < 7 / 10 ,第三坐标仍是 5 λ / 7 > 0 ;虽然参数和预测误差趋零,原始支持始终错误。取 r = 1 / 7 时,实际 ℓ ∞ 误差等于 r ,且 β min = 1 > 2 r ;阈值化保留两个 6 / 7 、删去 1 / 14 ,支持恢复。这是阈值化后的新规则。
正交例的目标差是
( 1 / 2 ) ( 2 / 5 ) 2 + ( 1 / 10 ) ( 2 / 5 ) = 3 / 25 。误差 ( − 1 / 10 , 2 / 5 ) 不属于 C ( { 1 } , 3 ) ,因为 2 / 5 > 3 / 10 。当 0 < λ < 1 时,候选 ( 1 − λ , 4 λ ) 的 gap 为 12 λ 2 ,锥不等式仍是 4 λ ≤ 3 λ ,对所有 λ > 0 都失败。
若拿到了正的 ϕ ( S , 4 ) ,可改用带容差保证
q 2 ≤ max { 16 λ 2 s / ϕ 4 2 , 8 δ } 与
‖ h ‖ 1 ≤ max { 20 λ s / ϕ 4 2 , 10 δ / λ } 。代入正交例的 δ = 3 / 25 、ϕ 4 2 = 1 ,得 q 2 ≤ max { 0.16 , 0.96 } = 0.96 、‖ h ‖ 1 ≤ max { 2 , 12 } = 12 ;实际值分别是 0.17 与 0.5 。其证明先看 ‖ h S ‖ 1 是否至少 2 δ / λ ,不能遗漏这个分情况。
答案五:保留方差、乐观度和删除规则
前一个核的特征值为 3 / 2 , 1 / 2 ,因此 S 的特征值为 3 / 4 , 1 / 2 ;两种迹分别是 5 / 4 与 13 / 16 。真实均值位于第二个特征方向,得到
均 值 风 险 训 练 残 差 均 方 期 望 均值风险 = 1 4 + 13 σ 2 32 , 训练残差均方期望 = 1 4 + 5 σ 2 32 , 新 响 应 风 险 新响应风险 = 1 4 + 45 σ 2 32 . 后两者差为 5 σ 2 / 4 = 2 σ 2 tr ( S ) / m ;均值风险中的噪声方差却使用 tr ( S 2 ) 。
对角核中 S = diag ( 9 / 10 , 1 / 10 ) 。逐点残差分别为 1 / 10 , 9 / 10 ,除以各自 1 − S i i 后都是一,所以 LOO 为一。GCV 用平均杠杆 1 / 2 ,给
[ ( 1 / 100 + 81 / 100 ) / 2 ] / ( 1 / 2 ) 2 = 41 / 25 。不等杠杆时两者不能互换。
常数核删点后,固定 ρ = 1 / 2 的单点目标是 ( s − 1 ) 2 + s 2 / 2 ,最优 s = 2 / 3 。固定平均损失惩罚 λ = 1 / 4 时,单点目标是 ( s − 1 ) 2 + s 2 / 4 ,最优 s = 4 / 5 。两种答案对应两种不同规则;都不能靠“是同一个核”来省略样本数定标。
答案六:继续学习响应,也继续学习噪声
第二轮过滤因子为 ( 3 / 4 , 39 / 400 ) ,第三轮为 ( 7 / 8 , 1141 / 8000 ) 。偏差平方只来自第一方向:
B 2 = 1 8 , B 3 = 1 32 . 方差分别是
V 2 = 1 2 [ ( 3 / 4 ) 2 + ( 39 / 400 ) 2 ] = 91521 320000 = 0.286003125 , V 3 = 1 2 [ ( 7 / 8 ) 2 + ( 1141 / 8000 ) 2 ] = 50301881 128000000 = 0.3929834453125 . 因此
R 2 = 131521 / 320000 = 0.411003125 ,
R 3 = 54301881 / 128000000 = 0.4242334453125 。风险确实增加约 0.01323032 。
期望训练目标从 180321 / 640000 = 0.2817515625 降到
52045881 / 256000000 = 0.20330422265625 。同设计新响应再加噪声方差一,测试风险从 1.411003125 升至 1.4242334453125 。而且训练下降不只是期望现象:对每个固定观测 Y ,各方向平方残差都逐轮收缩。
第二轮的 ridge 匹配参数由 λ = d ( 1 − g ) / g 给出,分别为 1 / 3 和 361 / 390 ,不相等。所谓 λ ≈ 1 / ( η t ) 只是弱特征方向的尺度近似,不是全谱恒等式。
独立验证集可以用于选择,但候选路径由训练响应生成,所选轮数仍间接依赖训练噪声。因此固定 t 的偏差方差恒等式不能直接对随机 T 使用;应分析实际选择规则,或用未参与选择的资料评价选出的模型。
执行时不用形成 S t 或做 SVD;每轮两个矩阵—向量乘法,稠密工作为 O ( n p ) ,T ≥ 1 时总工作为 O ( T n p ) ,额外工作空间为 O ( n + p ) ,数据存储另计。SVD 在本页用于证明过滤与风险,而非作为每次训练的强制步骤。
可选题答案:先控制未知信号,再决定训练多久
令 b j = v j T β 0 。偏差平方是 ∑ j d j ( 1 − η d j ) 2 t b j 2 ,而半径只允许 ∑ j b j 2 ≤ 2 ,不能给每个方向各分配两份平方质量。把全部质量放在系数最大的方向,得到
U ( t ) = 2 max j { d j ( 1 − η d j ) 2 t } + 1 2 ∑ j [ 1 − ( 1 − η d j ) t ] 2 . 对 η = 1 / 2 ,网格极小点为 t ^ = 2 ,
U ( 2 ) = 718247 / 1600000 = 0.448904375 。最坏方向是 v 2 ,由 β 0 = 2 v 2 达到;任务六的真参数为 2 v 1 ,风险为 0.411003125 。这说明包络保护整个参数球,不等于每个具体信号的风险。前四轮逐项比较后,余下轮次可由 V t ≥ V 4 > 9 / 20 > U ( 2 ) 一次排除。
改成 η = 1 时,第一方向的 a t 在每个 t ≥ 1 都为零,故从第一轮起 g t ( d 1 ) = 1 ,贡献恒定方差 1 / 2 。令 x t = ( 9 / 10 ) t ,第二方向给
U ( t ) = 1 2 + 1 5 x t 2 + 1 2 ( 1 − x t ) 2 = 1 − x t + 7 10 x t 2 , t ≥ 1. 这个二次式在 x = 5 / 7 处最小,而 x 3 = 729 / 1000 > 5 / 7 > x 4 = 6561 / 10000 。x t 随 t 下降,所以只需比较第三、第四轮,再与 U ( 0 ) = 2 比较。结果是
U ( 3 ) = 6430087 10000000 = 0.6430087 < 645227047 1000000000 = U ( 4 ) , 因此新网格选择 t ^ = 3 。步长加大没有使这套最坏风险证书变小,也不能由“学得更快”推出更好的风险。零轮始终取全部残差因子为一,不能把第一方向的 0 0 按后续轮数处理。
增加全零列不会改变正特征谱、拟合值或原设计上的包络;球内仍可取 2 v 2 达到上界。新增的真参数坐标完全不可见,算法保持该坐标为零,参数误差却要加上那个真坐标的平方,所以预测证书不等于参数恢复证书。
错误地用 R 2 = 1 ,第二轮会报告 293963 / 800000 = 0.36745375 ;题设真参数的风险仍为 0.448904375 ,保证已被违反。若真实噪声协方差是 4 I 2 ,原方差项须乘四;在同一最坏信号下第二轮风险为
130321 800000 + 4 91521 320000 = 1045531 800000 = 1.30691375 , 也不受原来的 0.448904375 控制。若正确使用精确方差四重算网格,则选择第一轮,包络为 201 / 200 = 1.005 。若掌握的只是可靠噪声上界,可得到保守上界,却不能据此把实际方差项或参数球最坏风险写成等号;零噪声配正的次高斯上尺度就是反例。
精确的有限网格结论比较的是事前给定网格中的确定轮数。它不涵盖所有估计器、读取响应的停止规则或随机混合,也不保证逐个真参数都取到最佳轮数。从同一标签估计方差后再选择,即使估计无偏,轮数仍依赖噪声,须另外分析实际选择流程。
把答案迁移到自己的问题
更换数据时,先把目标的样本数、惩罚和步长写在同一行,再确定预测是在原设计、新输入还是新响应上计分。重复列或近重复列出现时,分别检查可识别方向和受限常数;不要从零训练残差推断真实坐标已知。
更换求解器时,基本不等式只需要一份可验证的目标容差;更换噪声模型时,要重新建立相关性事件;更换支持报告规则时,要明确是否阈值化;更换停止规则时,要重新处理数据依赖。每次迁移都有一个具体接口需要重验,而不是整页定理无条件照搬。
选读:从可识别性走向无噪声稀疏解码
如果下一步是从少于坐标数的精确观测重建信号,可继续稀疏恢复终点练习 。它只需矩阵与范数入口,先从七个观测求八维候选,再分别给出可行对偶和统一矩阵证书;迁移到十五乘十六,并用可识别却被 ℓ 1 选错的二乘三反例检验边界。原始 Lasso 预测、参数与支持任务及 ridge/早停风险计算保持自己的目标;无噪声基追踪不是把这些统计保证换一个名字。
参考资料
本页全部数值由相应知识页的公式重算。证明和原始文献定位分别见基本不等式 理路 Lasso 基本不等式与预测误差 Lasso basic inequality · Lasso prediction error bound 从带优化容差的目标比较推导预测界与松弛锥,分清噪声事件、稀疏结构、设计条件和可计算证书各自的作用。 、受限设计 理路 受限特征值与稀疏可识别性 Restricted eigenvalue condition · Compatibility condition for Lasso · Lasso 兼容条件 在稀疏误差锥上定量比较预测与参数范数,精确定标兼容常数和受限特征值,并处理非零优化容差。 、支持恢复 理路 Lasso 支持恢复与不可表示条件 Lasso support recovery · Lasso sign consistency · Lasso irrepresentable condition 用活动集上的显式候选和非活动集的严格对偶余量证明符号恢复,区分可识别性、参数小误差、变量筛选和坐标推断。 、核岭回归 理路 核岭回归 kernel ridge regression · KRR · least-squares regularization network 用表示定理把 RKHS 平方损失正则化化为一个 Gram 线性系统。 和早停谱过滤 理路 线性模型早停的谱过滤 Early stopping spectral filter · Finite-time Landweber regularization 对零初始化线性梯度下降推导有限时刻过滤因子和精确风险,并在已知信号半径与噪声方差时,不看响应地选择有限网格中的停止轮数。 的参考资料。