形式陈述
设 K : X → Y 为实或复 Hilbert 空间间的紧算子,正奇异系统记为 ( σ n , u n , v n ) ,复内积第一变量共轭线性。固定真数据 y ∈ ran K ,令 x † = K † y ∈ ( ker K ) ⊥ 为最小范数精确解 理路 Picard 判据与紧算子的最小范数逆 Picard criterion · Picard solvability condition · Moore–Penrose inverse of a compact operator 以余核正交和加权平方和同时判定精确可解性,给出最小二乘逆的真正定义域,并算出 Green 数据的 q>5/2 阈值。 ,x n = ⟨ v n , x † ⟩ 。观测可以是任意 y δ ∈ Y ,只要求
‖ y δ − y ‖ ≤ δ , δ > 0. 这里没有噪声均值、独立性或分布假设;特别不要求 y δ 在 K † 的定义域内。
截断奇异值分解(TSVD)选阈值 τ > 0 ,保留满足 σ n ≥ τ 的方向:
x τ δ = R τ y δ := ∑ σ n ≥ τ ⟨ u n , y δ ⟩ σ n v n . 这是有限和,且
(1) ‖ x τ δ − x † ‖ ≤ δ τ + ( ∑ σ n < τ | x n | 2 ) 1 / 2 . 若 τ ( δ ) → 0 且 δ / τ ( δ ) → 0 ,则对每个固定真解,
(2) sup ‖ y δ − y ‖ ≤ δ ‖ R τ ( δ ) y δ − x † ‖ ⟶ 0. 零阶 Tikhonov 正则化选 α > 0 ,最小化
J α ( x ) = ‖ K x − y δ ‖ 2 + α ‖ x ‖ 2 . 它对每个 y δ ∈ Y 都有唯一极小点
x α δ = Q α y δ := ∑ n σ n σ n 2 + α ⟨ u n , y δ ⟩ v n , 并满足
(3) ‖ x α δ − x † ‖ ≤ δ 2 α + ( ∑ n ( α σ n 2 + α ) 2 | x n | 2 ) 1 / 2 . 若 α ( δ ) → 0 且 δ / α ( δ ) → 0 ,则式(2)中换成 Q α ( δ ) 后仍成立。α 是目标中平方范数的系数,分母是 σ n 2 + α ,不是 σ n 2 + α 2 。
直觉
直接求逆把第 n 个数据系数乘以 1 / σ n 。无限秩时这些放大率没有上界,小噪声可以藏在越来越弱的方向里。正则化先限制放大,再随着观测变准逐步放开限制。参数趋零只负责减少抹掉的真信号;参数与噪声同步变化,才控制放大后的噪声。
截断是把弱方向暂时关掉,Tikhonov 是把每个方向都收缩。两种方法都会产生偏差,但只要真解固定且属于 X ,被压住的尾部能量最终会消失。要给出统一的具体速度,还需知道真解在弱方向里究竟有多少能量。
图片加载失败 截断:有限和以外还有一个无穷尾部
紧性保证对每个正阈值只有有限个 σ n ≥ τ 。对任意 z ∈ Y ,正交性和 Bessel 不等式给
‖ R τ z ‖ 2 = ∑ σ n ≥ τ | ⟨ u n , z ⟩ | 2 σ n 2 ≤ τ − 2 ‖ z ‖ 2 . 所以 R τ 对全部数据都有定义,且算子范数至多 1 / τ 。当没有保留方向时,它就是零算子。
将误差拆成
R τ y δ − x † = R τ ( y δ − y ) + ( R τ K − I ) x † . 第一项至多 δ / τ ;第二项恰好是 − ∑ σ n < τ x n v n ,得到式(1)。给定 ε > 0 ,先由 ∑ | x n | 2 < ∞ 选有限头部,使剩余能量小于 ε 2 ;再让 τ 小到保留这整个头部,偏差就小于 ε 。这个顺序把固定真解的尾部控制和参数极限分开,不能由一次有限维试算代替。
Tikhonov:先证明级数和极小点确实存在
对任意 s ≥ 0 ,( s − α ) 2 ≥ 0 给
s 2 + α ≥ 2 s α , 0 ≤ s s 2 + α ≤ 1 2 α . 因此恢复系数的平方和满足
∑ n | σ n σ n 2 + α ⟨ u n , z ⟩ | 2 ≤ 1 4 α ‖ z ‖ 2 . 这保证 Q α z ∈ X ,并证明 ‖ Q α ‖ ≤ 1 / ( 2 α ) 。常数来自连续变量 s 的上界;给定算子的离散奇异值未必恰好取到等号。
令 A = K ∗ K 、z = Q α y δ 。按每个奇异方向计算得
( A + α I ) z = K ∗ y δ . 两边在核方向也都为零;由于 A 有界,可将它施于范数收敛的部分和再取极限。对任意 h ∈ X ,展开目标并用伴随恒等式得
J α ( z + h ) − J α ( z ) = ‖ K h ‖ 2 + α ‖ h ‖ 2 + 2 Re ⟨ h , K ∗ ( K z − y δ ) + α z ⟩ = ‖ K h ‖ 2 + α ‖ h ‖ 2 . 右边对非零 h 严格为正。这先构造了极小点,再证明唯一性,不借用有限矩阵必可逆去跳过无限维存在性。
Tikhonov 的偏差为何趋零
无噪声时 y n = σ n x n ,故
Q α y − x † = − ∑ n α σ n 2 + α x n v n . 每个固定 n 的因子趋于零,且始终在 [ 0 , 1 ] 内。先选有限头部,使尾部 ∑ n > N | x n | 2 < ε 2 / 2 ;再令 α 足够小,使前 N 项的加权平方和小于 ε 2 / 2 ,便得到总偏差小于 ε 。有限秩时只需控制有限头部。
再将噪声与偏差相加,
Q α y δ − x † = Q α ( y δ − y ) + ( Q α y − x † ) , 第一项至多 δ / ( 2 α ) ,所以得到式(3)。这些上界对同一噪声球内的所有观测同时成立;偏差项只依赖固定真解。两条同步参数规则因此分别推出两种方法的收敛。
例子与边界
同一个 Green 观测,直接逆与两种正则化
取Green 算子 理路 区间 Dirichlet Green 算子 Dirichlet Green operator on an interval · 区间零边界Green积分算子 用正核min(x,t)−xt构造−d²/dx²的零边界逆,证明正则性与全谱,并把共振积分方程准确转为边值问题。 T e n = σ n e n 、σ n = 1 / ( π 2 n 2 ) ,真数据和真解为
y = g 3 = ∑ n ≥ 1 n − 3 e n , x † = π 2 ∑ n ≥ 1 n − 1 e n . 观测 y δ = y + δ e m 满足误差恰为 δ ,且这个特定观测仍有精确原像。直接反演却得到
T † y δ − x † = π 2 m 2 δ e m . 取 δ m = 1 / ( π 2 m 2 ) ,观测误差趋零而恢复误差恒为一。失败来自随噪声水平变化的高频方向,固定一个 m 再令 δ → 0 看不见它。
TSVD 保留 n ≤ N τ ,其中
N τ = ⌊ 1 π τ ⌋ , x τ δ = ∑ n ≤ N τ ( π 2 n + π 2 n 2 δ 1 { n = m } ) e n . N τ = 0 时为空和。保留的噪声方向与删掉的真解尾部正交,所以还有精确误差式
‖ x τ δ − x † ‖ 2 = π 4 ∑ n > N τ 1 n 2 + π 4 m 4 δ 2 1 { m ≤ N τ } . 若 N τ ≥ 1 ,积分比较 ∑ n > N n − 2 ≤ 1 / N 进一步给可直接用的证书
‖ x τ δ − x † ‖ ≤ π 2 N τ + δ τ . 这里第一项控制无限尾部,第二项控制任何位置的噪声,而不仅是指定的 e m 。
对同一输入,Tikhonov 的每个解系数为
⟨ e n , x α δ ⟩ = π 2 / n + π 2 n 2 δ 1 { n = m } 1 + α π 4 n 4 . 式(3)化为
‖ x α δ − x † ‖ ≤ δ 2 α + [ ∑ n ≥ 1 π 4 n 2 ( α π 4 n 4 1 + α π 4 n 4 ) 2 ] 1 / 2 . 若程序只算前 N ≥ 1 个偏差项,余下平方和至多 π 4 / N ,因为括号内的收缩因子至多一。这个解析尾界可以和有限和合成可靠的数值上界;把有限和本身报告为完整误差则会漏算尾部。
参数要同步,极限顺序不能交换
在无量纲模型中,τ ( δ ) = δ 和 α ( δ ) = δ 都满足所需条件:对应噪声项分别至多 δ 和 δ / 2 ,偏差也趋零。有物理单位时应先固定数据、解及算子的尺度,再选择带相应单位的参数。
固定正参数再让噪声消失,通常会留下偏差;固定非零噪声却一味让参数趋零,则允许的放大无界。即便参数和噪声都趋零,也不能只检查这两个孤立事实。例如无限秩时取 x † = 0 、y δ n = σ n u n 、δ n = σ n 。若 TSVD 取 τ n = σ n ,它保留该方向,输出 v n ,误差恒为一;若 Tikhonov 取 α n = σ n 2 ,输出 v n / 2 ,误差恒为 1 / 2 。两种参数都趋零,但噪声比例没有趋零。
收敛的量词:固定真解,统一控制噪声
无限秩时,对任意 τ > 0 都有被删掉的 v n 。因此
sup x ∈ ( ker K ) ⊥ ‖ x ‖ ≤ 1 ‖ ( R τ K − I ) x ‖ = 1. Tikhonov 也有
sup x ∈ ( ker K ) ⊥ ‖ x ‖ ≤ 1 ‖ ( Q α K − I ) x ‖ = sup n α σ n 2 + α = 1. 每个固定真解的偏差趋零,与整个单位球上算子范数误差趋零是不同的命题。上面的极限只把噪声球取上确界,没有把所有真解也一起取上确界。
推论与应用
一个能完全证明的源条件速率
现在额外知道
(4) x † = ( K ∗ K ) w , ‖ w ‖ ≤ ρ , ρ > 0. 这称为源条件:在右奇异坐标上,x n = σ n 2 w n 。弱方向中的真解系数必须比一般平方可和向量再多衰减一个 σ n 2 ,它不是从“存在精确解”自动得到的。
Tikhonov 偏差系数为
α σ n 2 + α x n = α σ n 2 σ n 2 + α w n . 乘数不超过 α ,Bessel 不等式遂给偏差至多 α ρ 。于是对全部允许噪声都有
(5) ‖ x α δ − x † ‖ ≤ α ρ + δ 2 α . 选取方便的同步尺度 α = ( δ / ρ ) 2 / 3 ,两项直接化为
(6) ‖ x α δ − x † ‖ ≤ 3 2 ρ 1 / 3 δ 2 / 3 . 这是一个明确选择所产生的常数,不宣称该选择使式(5)最小。实际极小化该上界,求导会给 α = ( δ / ( 4 ρ ) ) 2 / 3 ;本页用式(6)强调噪声与先验尺度如何一起决定参数。
例如 Green 模型取 w = e 1 、ρ = 1 ,则 x † = π − 4 e 1 、y = π − 6 e 1 ,确实满足式(4),可使用式(6)。前面的 g 3 虽有平方可积原像,却不满足这个源条件:若 x n = π 2 / n = σ n 2 w n ,就要求 w n = π 6 n 3 ,不属于 ℓ 2 。因此不能把相同速率无条件加到前一例上。
恢复的是哪一个解
两种恢复都只落在 ( ker K ) ⊥ 。如果实际输入为 x t r u e = x † + z 、z ∈ ker K ,数据仍是同一个 y ,而
‖ x r e g δ − x t r u e ‖ 2 = ‖ x r e g δ − x † ‖ 2 + ‖ z ‖ 2 . 噪声趋零也不会恢复不可见的核分量。有限秩时,阈值低于最小正奇异值后 TSVD 已没有截断偏差;零算子时两种恢复都为零。上面的定义和界在这两个分支都直接成立。
如果真数据仅属于 D ( K † ) 而非值域,余核分量被两种恢复共同忽略,同一证明收敛到最小范数最小二乘解。若固定真数据连 Picard 判据页的加权平方和条件都不满足,则没有这样的目标解;不能把“每个正参数下输出存在”改写为存在一个无参数极限解。
与有限维计算、统计风险的接口
有限维 QR/SVD 求解 理路 用 QR 与 SVD 求最小二乘 Least squares via QR · Least squares via SVD · Numerical least squares 以 QR 作为满列秩最小二乘的默认计算路线,并用 SVD 处理秩亏、欠定和最小范数解。 已经解释阈值截断会改变所解问题;这里进一步证明,在无限多弱方向存在时,如何让这种改变随噪声消失。核岭回归 理路 核岭回归 kernel ridge regression · KRR · least-squares regularization network 用表示定理把 RKHS 平方损失正则化化为一个 Gram 线性系统。 和早停谱过滤 理路 线性模型早停的谱过滤 Early stopping spectral filter · Finite-time Landweber regularization 对零初始化线性梯度下降推导有限时刻过滤因子和精确风险,并在已知信号半径与噪声方差时,不看响应地选择有限网格中的停止轮数。 给固定设计下的偏差—方差期望;本页给每一个满足范数误差界的观测都成立的确定性证书,因而没有把方差项用作最坏噪声上界。
紧逆问题终点练习 用同一 Green 噪声、Volterra 的结构迁移和核/余核边界检验这些结论。附带程序只复算有限系数及解析误差界,收敛仍由本页的头部—尾部证明保证。
参考资料
Christian Clason,Regularization of Inverse Problems , arXiv:2001.00617v2 ,2021-02-08 提交、封面日期 2021-02-09;Example 5.2,印刷页45–46,给两种过滤器;Theorem 5.6 与 Example 5.7,印刷页48–49,给固定数据收敛与截断的同步选择;第6章,印刷页58–59、Theorem 6.5,印刷页62,给 Tikhonov 及其极小化形式。原讲义采用实 Hilbert 空间,本文的复数极小化计算明确保留实部。
同一讲义 §4.2 与第6章讨论源条件。本文只使用 x † = ( K ∗ K ) w ,直接证明式(5);噪声常数 1 / 2 、式(6)的具体常数和 Green 系数均在正文独立计算,不借用一般阶最优性结论。