形式陈述
固定的几何,随机的响应
本页采用固定设计的线性回归模型 理路 线性回归统计模型 Linear regression model · Linear model 响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。
(1) Y = X β + ε , ε ∼ N n ( 0 , σ 2 I n ) , σ > 0. X ∈ R n × p 已知、满列秩,p ≥ 1 且n ≥ 2 p ;β 与σ 未知。真实零集合是H 0 = { j : β j = 0 } 。概率只来自响应以及算法预先引入的独立随机性。本页的直接构造不处理n < 2 p ,这不是声称该范围绝无其他构造。
记Σ = X T X 。它是正定矩阵 理路 正定与半正定矩阵 Positive definite matrix · Positive semidefinite matrix · PSD matrix 由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。 ,这里没有除以n 。构造只使用X和独立于Y的预先随机数,不用响应来挑D、U或C。选对角矩阵D = diag ( s 1 , … , s p ) ,满足D ⪰ 0 、2 Σ − D ⪰ 0 。替身矩阵X ~ ∈ R n × p 的目标是
(2) X ~ T X ~ = Σ , X T X ~ = Σ − D . 因此不同编号的原列与替身列保持同样内积,只有第j 列和自己的替身之间,内积减少s j 。
取U ∈ R n × p 满足U T U = I p 、U T X = 0 ,再取C ∈ R p × p 满足
C T C = 2 D − D Σ − 1 D . 构造为
(3) X ~ = X ( I p − Σ − 1 D ) + U C . 后文证明这样的U , C 存在,并验证式(2)。当C 秩亏时仍允许生成,不要求它可逆。
分数必须怎样对待两套列
记增广矩阵A = [ X X ~ ] 。统计量W ∈ R p 要同时满足两项条件:
充分性接口: 存在同一个可测函数f ,使W = f ( A T A , A T Y ) 。这里是对统计量允许使用的信息作限制;不必先把它称为整个模型的最小充分统计量。
交换反对称性: 把任意第j 原列与第j 替身列交换后,W j 变号,其余坐标不变;多个互不相同的交换同时执行时,恰好翻转对应的符号。
一个容易核验的选择是
(4) W j = | X j T Y | − | X ~ j T Y | . 更复杂的增广模型拟合也可以产生分数,但解的选择、调参和并列处理都须保留这两项性质。仅仅“把两套列都输入了学习器”并不能证明反对称性。
在式(1)与这些条件下,给定全部| W j | 和j ∉ H 0 的W j ,非零真零分数的符号独立公平。因而将W 送入Knockoff+筛选 理路 Knockoff 符号筛选 Knockoff filter · Knockoff+ · Knockoff plus 用零假设坐标的联合条件符号对称性选择数据依赖阈值,并完整证明Knockoff+的有限样本FDR保证。 ,就有有限样本FDR不超过预定q 。
直觉
替身不能是与所有原列都无关的噪声列。一个无效变量仍可能因为与真正有效的变量相关,而与响应有明显关联;它的替身需要保留这种“通过其他列获得的关联”。式(2)让每对竞争者面对其他变量时处于相同几何位置。
构造中的第一项位于原设计的列空间,负责与原列保持指定内积。第二项U C 位于其正交补,不改变这些交叉内积,却补足替身自己的长度和相互内积。n ≥ 2 p 保证正交补至少有p 个方向可用。
本页并未把设计矩阵本身随机化成一对可交换样本。交换后的增广矩阵通常就是另一张不同的固定矩阵;真正不变的是充分统计向量在正态响应模型下的分布。这正是充分性接口的作用。
例子与边界
两列相关设计的全有理构造
取
X = ( 1 3 / 5 0 4 / 5 0 0 0 0 ) , Σ = ( 1 3 / 5 3 / 5 1 ) , D = 16 25 I 2 . Σ 的特征值为2 / 5 , 8 / 5 ,所以2 Σ − D 的最小特征值为4 / 25 > 0 。直接计算得到
I − Σ − 1 D = ( 0 3 / 5 3 / 5 0 ) , C = ( 4 / 5 12 / 25 0 16 / 25 ) . 取U = [ e 3 e 4 ] ,则
(5) X ~ = ( 9 / 25 3 / 5 12 / 25 0 4 / 5 12 / 25 0 16 / 25 ) . 两列替身的长度平方都是1,内积为3 / 5 ;原列与自己的替身内积为9 / 25 ,与另一替身内积为3 / 5 。这四种数值分别检查了式(2)的对角与非对角责任。
若响应为y = ( 7 , 9 / 4 , − 13 / 4 , − 41 / 16 ) T ,则X T y = ( 7 , 6 ) T 、X ~ T y = ( 1 , 1 ) T ,式(4)给W = ( 6 , 5 ) 。两个正分数不意味着低FDR阈值下一定能选:例如q = 1 / 4 至少需要四项入选,加一规则在这里只能返回空集。终点把三块这样的设计组合起来,才完成有发现的选择与全符号风险枚举。
一个边界不应被另一个条件替代
D = 0 总合法,但式(3)退化为X ~ = X ,任何满足反对称性的确定分数都为零。这是正确却无识别能力的替身。选择较大的s j 有助于区分竞争者,但必须一起满足矩阵半正定约束,不能逐坐标随意增大。
在单位正交设计Σ = I p 下,D = I p 可让替身与原设计正交;相关设计一般做不到同时保留式(2)并令交叉Gram为零。随机打乱行或独立生成噪声,即使保持各列方差,也未必保留所有非对角内积。
如果误差只同方差不相关而非联合正态,下面由均值和协方差识别分布的步骤没有依据。如果误差协方差为一般Ω ,充分统计量的协方差变成A T Ω A ,式(2)也不再自动使它交换不变。模型改变后须重证分布,不宜只换标准误。
数值计算中“两个Gram很接近”同样不等于式(2)精确成立。浮点残差是诊断,有限误差下的FDR偏离需要额外稳健性定理;本页不给未证明的误差容限。
推论与应用
存在性与两个Gram等式
块矩阵
G = ( Σ Σ − D Σ − D Σ ) 在和、差正交坐标( u + v ) / 2 , ( u − v ) / 2 下变成diag ( 2 Σ − D , D ) ,因此G ⪰ 0 恰好对应所列两个半正定条件。进一步令H = Σ − 1 / 2 D Σ − 1 / 2 ,则0 ⪯ H ⪯ 2 I ,从而
2 D − D Σ − 1 D = Σ 1 / 2 ( 2 H − H 2 ) Σ 1 / 2 ⪰ 0. 正定/半正定矩阵的平方根构造遂给出C T C 分解,零特征值也可保留。另一方面,dim col ( X ) ⊥ = n − p ≥ p ,所以可选p 个正交单位向量组成U 。
式(3)的交叉项立即给X T X ~ = Σ − D 。由于X T U = 0 ,替身的Gram为
X ~ T X ~ = ( I − D Σ − 1 ) Σ ( I − Σ − 1 D ) + C T C = Σ − 2 D + D Σ − 1 D + 2 D − D Σ − 1 D = Σ . 这证明构造确实完成两个目标,而不只是通过了正定性检查。
为什么只在真实零坐标上分布不变
令P S 为交换原/替身第j 对、j ∈ S 的置换矩阵。D 为对角阵意味着不同编号之间的四种交叉内积相同,所以
P S T G P S = G 对任意S 成立。对于A T Y ,调用联合正态的线性变换 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 可得
(6) A T Y ∼ N 2 p ( ( Σ β ( Σ − D ) β ) , σ 2 G ) . 交换第j 对时,均值中两项的差是s j β j 。若S ⊆ H 0 ,这些差都为零,所以均值和协方差均保持不变。联合正态律由这两项确定,即使G 奇异也成立,故P S T A T Y = d A T Y 。
充分性把式(6)的不变性传给统计量,反对称性把同一交换解释为指定坐标变号。因此W 的分布在任意真零符号翻转下不变。条件于全部绝对值和非零假设分数后,该条件分布仍不变;在非零真零坐标的2 m 种符号向量之间,翻转群作用传递,所以每种概率都为2 − m 。这恰是联合条件公平性,而不是仅有各边缘正负概率相同。
最后调用Knockoff+定理,将这个符号合同变成FDR保证。设计几何负责产生合法分数;阈值定理负责数据依赖选择,两步责任各自清楚。
计算接口与模型选择
实现式(3)时可用QR的正交补 理路 QR 分解 QR factorization · QR decomposition · Economy-size QR 把长方矩阵分解为正交列与上三角因子,并区分经济型表示、数值算法和秩亏边界。 产生U :保存X 的Householder反射,把完整正交矩阵中第p + 1 至2 p 列应用出来即可,不必显式保存n × n 矩阵。形成Gram、解Σ B = D 、计算p × p 半正定因子并组装替身,稠密算术成本为O ( n p 2 + p 3 ) ,存储为O ( n p + p 2 ) 。这里把D 作为已经给定且经验证的输入;额外优化D 的成本另计。
求逆符号Σ − 1 D 在程序中应通过线性方程求解实现。接近秩亏的设计会同时影响Gram和因子的可靠性;满秩这一数学输入不能由一个任意浮点容差自动认证。
Lasso支持恢复 理路 Lasso 支持恢复与不可表示条件 Lasso support recovery · Lasso sign consistency · Lasso irrepresentable condition 用活动集上的显式候选和非活动集的严格对偶余量证明符号恢复,区分可识别性、参数小误差、变量筛选和坐标推断。 要求把整个支持恢复正确,通常消费额外的信号强度及设计条件;本页允许漏选与部分错选,控制的是所选集合的平均错误比例。去偏Lasso 理路 去偏 Lasso 与坐标置信区间 Debiased Lasso · de-biased Lasso · de-sparsified Lasso · desparsified Lasso · 去稀疏 Lasso 用近似逆矩阵修正 Lasso 的残差得分,将坐标误差拆成高斯主项与可控制的乘积余项,并据此构造置信区间。 提供另一类渐近坐标推断。应按需要的结论选择接口,而不是看到稀疏回归就交换它们的保证。
参考资料