Skip to content

正则化学习保证:预测、参数与支持 ​

形式陈述 ​

本页的终点是完成一份有条件、有数值、能说明迁移边界的学习保证。你将分别回答:训练目标离最优多远,原设计上的均值预测误差多大,真实系数是否可辨认,非零名单是否正确,以及再做一轮训练是否改善测试风险。

主线为优化间隙 → 基本不等式 → 受限设计 → 支持恢复 → 岭的风险账本 → 有限时间谱过滤。前三站把一个数值候选转成有条件的统计误差界;第四站检查变量名单;后两站用精确谱计算理解收缩与早停。

如果还不熟悉符号,先补矩阵乘法、向量范数、最小二乘和信号加噪声模型。‖h‖1 是绝对值之和,‖h‖22 是平方之和,Xh 是每个设计点因参数误差而改变的预测。谱部分再补奇异值分解和偏差—方差分解。没有必要先读完全部统计学习理论才开始下面的小矩阵计算。

坐标置信区间是参数推断分支,选择后推断是报告规则分支。它们各自处理新的概率目标,不自动成为本页全部计算的前置。

直觉 ​

同一份拟合可以有几种不同的成功。预测只看 Xh,参数误差看 h,支持恢复则把每个坐标是否恰为零当作离散判断。重复列让前两者分离;很小的错误非零系数让后两者分离。

ridge 与早停的另一条分界是信号和噪声。继续接近训练响应会降低残差,却可能把更多噪声带进预测。把风险分成两项再相加,才能判断这一步究竟值不值得。

计算时保持三个定标不变:Lasso 用 ‖Y−Xβ‖2/(2n)+λ‖β‖1;岭用 ‖Y−Xβ‖2/(2n)+(λ/2)‖β‖22;早停对半平均平方损失用步长 η。其他页面的损失若没有除以样本数,惩罚和步长必须一起换算。

例子与边界 ​

任务一:把旧优化证书接过来 ​

旧 Lasso 优化页的观测数为 n=3,未归一化惩罚为 1,第二轮候选的可行 gap 是 G=1/36。

  1. 换成这里的半平均平方损失目标后,λ 和 δ 分别是多少?
  2. 这个 gap 能否单独证明候选的支持就是真实支持?
  3. 若算法只报告目标下降了 0.1,却没有下界,能否把 0.1 直接当作剩余优化误差?

任务二:一个可识别设计,分别回答三种误差 ​

取 n=3,p=2,

X1=3(1,0,0)T,X2=3(1/2,3/2,0)T,β0=(1,0)T,Y=Xβ0,λ=1/4.
  1. 写出 Γ=XTX/n,用 KKT 验证 β^=(3/4,0),说明唯一性
  2. 分别计算 q2=‖X(β^−β0)‖22/n、ℓ1 与 ℓ2 参数误差、估计支持
  3. 对 S={1}、c=3 算 κ2,ϕ2,α2;代入误差界,区分实际误差与上界
  4. 用 M=I2 和 M=Γ−1 分别作一步去偏。若随后把模型改为 ε∼N3(0,σ2I3) 的 Gaussian 噪声,精确逆修正的两个坐标方差是多少?无噪声算例本身能否证明置信区间覆盖?

任务三:只改成重复列 ​

保留任务二的第一列,令 X2=X1,其余无噪声信号与 λ 不变。

  1. 求全部 Lasso 解,比较其中 (3/4,0) 与 (0,3/4) 的预测误差和系数误差
  2. 构造两个不同的一稀疏真参数,使全部观测分布相同。为什么任何算法都无法在这两个模型上同时可靠恢复支持?
  3. 算受限常数及第一坐标逆行的最小 ℓ∞ 缺陷
  4. 若未来输入固定为 (1,0),原训练预测界能否通过某个有限 C 的 Σ∗⪯CΓ 迁移?

任务四:有曲率仍会选错,近似解还要另留预算 ​

先取无噪声模型

Γ=(103/5013/53/53/51),β0=(1,1,0)T,λ=1/10.

证明它全局正定,核验唯一解 (6/7,6/7,1/14),计算预测误差,并判断 λ↓0 时原始支持是否恢复。再用已知 ℓ∞ 误差上界 r=1/7 检查阈值化规则 |β^j|>r。

另取 Γ=I2、无噪声 β0=(1,0)、λ=1/10。候选 (9/10,2/5) 的目标差是多少?它是否属于 C({1},3)?用 ϕ42=1 的带容差界算预测与 ℓ1 上界,再与实际误差比较。令 0<λ<1,把系数写成 (1−λ,4λ) 后,优化 gap 趋零能否改变答案?

任务五:两个不同的迹与一次 GCV 误差 ​

对

K=(11/21/21),m=2,ρ=mλ=1/2,

令真实均值 μ=(1,−1),噪声均值零、协方差 σ2I2。

  1. 算 S=K(K+ρI)−1 的特征值、tr(S) 与 tr(S2)
  2. 算均值预测风险、平均训练残差的期望及相同设计上独立新响应风险
  3. 改取 ρ=1、K=diag(9,1/9)、y=(1,1),分别算固定 ρ 的精确 LOO 与 GCV
  4. 回到常数核 K=11T、m=2、y=(1,0)、平均损失惩罚 λ=1/4。删去第二点后,固定 ρ=1/2 与固定 λ=1/4 分别给什么预测?

任务六:训练还在下降,测试风险已经回升 ​

固定

X=diag(2,1/5),μ=(2,0),σ2=1,η=1/2,

观察 Y=μ+ε,其中 Eε=0、Cov(ε)=I2;所说的新响应由同一模型独立重抽。从零开始对半平均平方损失做梯度下降。

  1. 算 t=2,3 的两个过滤因子、偏差平方、方差及均值预测风险
  2. 算这两轮的期望训练目标,再换算同设计独立新响应的测试风险
  3. 第2轮要与 ridge 逐方向匹配,各自需要哪个 λ?是否有同一个值?
  4. 如果读完同一训练路径再用独立验证集挑轮次,能否把所选随机 T 直接代入固定时刻风险公式?
  5. 给出执行 T 轮、只返回 βT 时的稠密计算成本与额外工作空间,说明 SVD 是否必需

可选题:在看标签前选停止轮数 ​

保留任务六的设计,改为只知道 ‖β0‖22≤2,不再知道信号的方向。噪声的精确协方差为 I2;候选轮数预定为 T={0,1,…,12},并列时选较早轮数。

  1. 从固定时刻风险推出参数球上的精确最坏风险 U(t),说明为什么偏差项用最大值,而不是把各方向的最坏偏差相加
  2. 对 η=1/2 选出停止轮数。写出包络、达到包络的真参数,并比较它与任务六具体信号的风险
  3. 把步长改成 η=1,其余输入不变。重新选择轮数,不直接沿用第二轮;第一方向从第几轮起完全学到?t=0 又如何定义?若再给 X 加一列全零特征,原设计预测证书与参数误差结论各有什么变化?
  4. 回到 η=1/2。若误用 R2=1 而真参数为 2v2,第二轮报告的上界是否可靠?若误把实际噪声协方差 4I2 当成 I2,原包络又在哪一项失效?若只知道一个次高斯上尺度,能否声称式(11)的等号?
  5. 明确上述极小极大结论究竟在哪些候选规则间成立。若把噪声方差换成同一标签计算的无偏估计,原证明能否原样使用?

可以用精确分数复算程序核对全部候选;先写出风险模型与达到上界的参数,再与输出比较。

推论与应用 ​

答案一:先统一目标,再谈统计条件 ​

把旧目标整体除以三,得 λ=1/3、δ=G/3=1/108。目标的最优参数不变,但目标差也要同比例变化。

gap 只认证当前惩罚训练目标的次优量,不知道真参数或噪声,所以不能独自证明真实支持。一次下降 0.1 只比较两个候选;它没有给出距未知最优值的下界差,故也不是剩余优化误差证书。

答案二:可辨不意味着没有收缩 ​

Γ=(11/21/21),最小特征值是 1/2>0。候选残差 X1/4 的得分是 (1/4,1/8),第一坐标匹配正号阈值,第二坐标严格在阈值内,所以候选最优;正定性给唯一性。

误差为 h=(−1/4,0),故 q2=1/16、‖h‖1=‖h‖2=1/4,支持是 {1},恰与真支持相同。三个结论分别回答预测、系数和非零名单,不能只报“恢复了”。

令 h=h1(1,t)、|t|≤3。支持内分母下的最小二次式为 min(1+t+t2)=3/4,在 t=−1/2 取得;全向量分母下的最小值为 1/2,在 t=−1 取得。因此 κ2=ϕ2=3/4、α2=1/2。相应界为 q2≤3/4、‖h‖1≤4、‖h‖2≤3/2。这些是保证上界,均不是本次实际误差。

单位修正得到 (3/4,0)+(1/4,1/8)=(1,1/8)。精确逆 Γ−1=(4/3−2/3−2/34/3) 则得到 (1,0)。加上 Gaussian 噪声后,精确逆修正恒等于 OLS,协方差为 σ2Γ−1/3,两个坐标方差都是 4σ2/9,协方差是 −2σ2/9。确定性的无噪声计算验证了代数,区间覆盖仍需要相应的噪声模型与尺度条件。

答案三:预测可用,坐标与支持不可辨 ​

所有最优解为 (a,3/4−a),0≤a≤3/4。两个端点都预测 3X1/4,故 q2=1/16。第一端点相对 β0=(1,0) 的 ℓ1 与 ℓ2 误差都是 1/4;第二端点的误差为 (−1,3/4),故分别为 7/4 与 5/4。

真参数 (1,0) 与 (0,1) 的均值相同,再配同一噪声分布就有完全相同的观测分布。某算法输出支持 {1} 与 {2} 是互斥事件,在这个共同分布下二者概率之和至多一。因此至少一个真模型上的成功概率不超过 1/2,无法让两者都趋一。

向量 (1,−1) 位于误差锥且被 X 消去,所以三个受限常数都是零。任何逆行给 Γm=(a,a),故 infamax{|1−a|,|a|}=1/2,在 a=1/2 达到。这个缺陷不能靠更多优化迭代消除。

未来矩阵 Σ∗=diag(1,0) 在 v=(1,−1) 上给 vTΣ∗v=1,而 vTΓv=0。所以不存在有限 C 满足矩阵比较,原设计的预测保证不能这样迁移。

答案四:曲率控制大小,严格为零另需条件 ​

三列设计的特征值是 1 和 1±32/5,全部为正。由于 Γ−11=(10/7,10/7,−5/7), 候选 β0−λΓ−11 的三坐标为正、得分为 λ1,满足全部 KKT,故为唯一解。

预测误差为 λ21TΓ−11=3/140。对每个 0<λ<7/10,第三坐标仍是 5λ/7>0;虽然参数和预测误差趋零,原始支持始终错误。取 r=1/7 时,实际 ℓ∞ 误差等于 r,且 βmin=1>2r;阈值化保留两个 6/7、删去 1/14,支持恢复。这是阈值化后的新规则。

正交例的目标差是 (1/2)(2/5)2+(1/10)(2/5)=3/25。误差 (−1/10,2/5) 不属于 C({1},3),因为 2/5>3/10。当 0<λ<1 时,候选 (1−λ,4λ) 的 gap 为 12λ2,锥不等式仍是 4λ≤3λ,对所有 λ>0 都失败。

若拿到了正的 ϕ(S,4),可改用带容差保证 q2≤max{16λ2s/ϕ42,8δ} 与 ‖h‖1≤max{20λs/ϕ42,10δ/λ}。代入正交例的 δ=3/25、ϕ42=1,得 q2≤max{0.16,0.96}=0.96、‖h‖1≤max{2,12}=12;实际值分别是 0.17 与 0.5。其证明先看 ‖hS‖1 是否至少 2δ/λ,不能遗漏这个分情况。

答案五:保留方差、乐观度和删除规则 ​

前一个核的特征值为 3/2,1/2,因此 S 的特征值为 3/4,1/2;两种迹分别是 5/4 与 13/16。真实均值位于第二个特征方向,得到

均值风险=14+13σ232,训练残差均方期望=14+5σ232,新响应风险=14+45σ232.

后两者差为 5σ2/4=2σ2tr(S)/m;均值风险中的噪声方差却使用 tr(S2)。

对角核中 S=diag(9/10,1/10)。逐点残差分别为 1/10,9/10,除以各自 1−Sii 后都是一,所以 LOO 为一。GCV 用平均杠杆 1/2,给 [(1/100+81/100)/2]/(1/2)2=41/25。不等杠杆时两者不能互换。

常数核删点后,固定 ρ=1/2 的单点目标是 (s−1)2+s2/2,最优 s=2/3。固定平均损失惩罚 λ=1/4 时,单点目标是 (s−1)2+s2/4,最优 s=4/5。两种答案对应两种不同规则;都不能靠“是同一个核”来省略样本数定标。

答案六:继续学习响应,也继续学习噪声 ​

第二轮过滤因子为 (3/4,39/400),第三轮为 (7/8,1141/8000)。偏差平方只来自第一方向:

B2=18,B3=132.

方差分别是

V2=12[(3/4)2+(39/400)2]=91521320000=0.286003125,V3=12[(7/8)2+(1141/8000)2]=50301881128000000=0.3929834453125.

因此 R2=131521/320000=0.411003125, R3=54301881/128000000=0.4242334453125。风险确实增加约 0.01323032。

期望训练目标从 180321/640000=0.2817515625 降到 52045881/256000000=0.20330422265625。同设计新响应再加噪声方差一,测试风险从 1.411003125 升至 1.4242334453125。而且训练下降不只是期望现象:对每个固定观测 Y,各方向平方残差都逐轮收缩。

第二轮的 ridge 匹配参数由 λ=d(1−g)/g 给出,分别为 1/3 和 361/390,不相等。所谓 λ≈1/(ηt) 只是弱特征方向的尺度近似,不是全谱恒等式。

独立验证集可以用于选择,但候选路径由训练响应生成,所选轮数仍间接依赖训练噪声。因此固定 t 的偏差方差恒等式不能直接对随机 T 使用;应分析实际选择规则,或用未参与选择的资料评价选出的模型。

执行时不用形成 St 或做 SVD;每轮两个矩阵—向量乘法,稠密工作为 O(np),T≥1 时总工作为 O(Tnp),额外工作空间为 O(n+p),数据存储另计。SVD 在本页用于证明过滤与风险,而非作为每次训练的强制步骤。

可选题答案:先控制未知信号,再决定训练多久 ​

令 bj=vjTβ0。偏差平方是 ∑jdj(1−ηdj)2tbj2,而半径只允许 ∑jbj2≤2,不能给每个方向各分配两份平方质量。把全部质量放在系数最大的方向,得到

U(t)=2maxj{dj(1−ηdj)2t}+12∑j[1−(1−ηdj)t]2.

对 η=1/2,网格极小点为 t^=2, U(2)=718247/1600000=0.448904375。最坏方向是 v2,由 β0=2v2 达到;任务六的真参数为 2v1,风险为 0.411003125。这说明包络保护整个参数球,不等于每个具体信号的风险。前四轮逐项比较后,余下轮次可由 Vt≥V4>9/20>U(2) 一次排除。

改成 η=1 时,第一方向的 at 在每个 t≥1 都为零,故从第一轮起 gt(d1)=1,贡献恒定方差 1/2。令 xt=(9/10)t,第二方向给

U(t)=12+15xt2+12(1−xt)2=1−xt+710xt2,t≥1.

这个二次式在 x=5/7 处最小,而 x3=729/1000>5/7>x4=6561/10000。xt 随 t 下降,所以只需比较第三、第四轮,再与 U(0)=2 比较。结果是

U(3)=643008710000000=0.6430087<6452270471000000000=U(4),

因此新网格选择 t^=3。步长加大没有使这套最坏风险证书变小,也不能由“学得更快”推出更好的风险。零轮始终取全部残差因子为一,不能把第一方向的 00 按后续轮数处理。

增加全零列不会改变正特征谱、拟合值或原设计上的包络;球内仍可取 2v2 达到上界。新增的真参数坐标完全不可见,算法保持该坐标为零,参数误差却要加上那个真坐标的平方,所以预测证书不等于参数恢复证书。

错误地用 R2=1,第二轮会报告 293963/800000=0.36745375;题设真参数的风险仍为 0.448904375,保证已被违反。若真实噪声协方差是 4I2,原方差项须乘四;在同一最坏信号下第二轮风险为

130321800000+491521320000=1045531800000=1.30691375,

也不受原来的 0.448904375 控制。若正确使用精确方差四重算网格,则选择第一轮,包络为 201/200=1.005。若掌握的只是可靠噪声上界,可得到保守上界,却不能据此把实际方差项或参数球最坏风险写成等号;零噪声配正的次高斯上尺度就是反例。

精确的有限网格结论比较的是事前给定网格中的确定轮数。它不涵盖所有估计器、读取响应的停止规则或随机混合,也不保证逐个真参数都取到最佳轮数。从同一标签估计方差后再选择,即使估计无偏,轮数仍依赖噪声,须另外分析实际选择流程。

把答案迁移到自己的问题 ​

更换数据时,先把目标的样本数、惩罚和步长写在同一行,再确定预测是在原设计、新输入还是新响应上计分。重复列或近重复列出现时,分别检查可识别方向和受限常数;不要从零训练残差推断真实坐标已知。

更换求解器时,基本不等式只需要一份可验证的目标容差;更换噪声模型时,要重新建立相关性事件;更换支持报告规则时,要明确是否阈值化;更换停止规则时,要重新处理数据依赖。每次迁移都有一个具体接口需要重验,而不是整页定理无条件照搬。

选读:从可识别性走向无噪声稀疏解码 ​

如果下一步是从少于坐标数的精确观测重建信号,可继续稀疏恢复终点练习。它只需矩阵与范数入口,先从七个观测求八维候选,再分别给出可行对偶和统一矩阵证书;迁移到十五乘十六,并用可识别却被 ℓ1 选错的二乘三反例检验边界。原始 Lasso 预测、参数与支持任务及 ridge/早停风险计算保持自己的目标;无噪声基追踪不是把这些统计保证换一个名字。

参考资料 ​

本页全部数值由相应知识页的公式重算。证明和原始文献定位分别见基本不等式、受限设计、支持恢复、核岭回归和早停谱过滤的参考资料。