形式陈述
先定义所要发现的关联
设一份总体观测为( X , Y ) ,X = ( X 1 , … , X p ) ∈ R p ,Y 取值于标准Borel空间。协变量联合律P X 已知,响应的条件分布 理路 条件分布 Conditional distribution · Regular conditional distribution 给定观测值后随机量的概率律,以及它与原联合分布相容的核表示。 P Y ∣ X 不作线性、正态或稀疏参数形式限制。第j 个零假设是
(1) H j : Y ⊥ X j ∣ X − j , 其中X − j 删除第j 坐标。这里的条件独立 理路 独立性 Statistical independence 从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。 意味着:给定其余变量后,该坐标不再改变响应的条件律。它不等价于边缘无相关,也不自动是一项因果无效结论。
Model-X替身是与原变量联合生成的X ~ ∈ R p ,满足
对 每 个 (2) ( X , X ~ ) swap ( S ) = d ( X , X ~ ) 对每个 S ⊆ { 1 , … , p } , X ~ ⊥ Y ∣ X . swap ( S ) 只交换每个j ∈ S 的X j 和X ~ j ,不把不同编号的变量任意互换。第二条可以通过从只依赖X 的已知核、用独立新随机数生成替身来实现。只证明两个向量边缘同分布,不够得到第一条。
若数据是n ≥ 1 份IID总体观测,对各行独立应用同一复制核,形成n × p 矩阵X , X ~ 与响应向量y 。本页用同一个字母表示总体向量与数据矩阵,维度随语境注明;p 不受n 上界限制。
分数与选择保证
取可测统计量W = w ( [ X X ~ ] , y ) ∈ R p ,要求交换任意一对列时恰好翻转相应的W j ,其余分数不变。统计量可以使用整个增广数据,不限于Gram和线性得分。算法随机性须独立于数据,并在条件于随机种子后保持上述交换规则,或直接证明完整随机算法满足同样的分布对称性。
在式(2)下,所有真实H j 对应的非零W j ,给定绝对值和非零假设分数后,具有独立公平的符号。于是Knockoff+ 理路 Knockoff 符号筛选 Knockoff filter · Knockoff+ · Knockoff plus 用零假设坐标的联合条件符号对称性选择数据依赖阈值,并完整证明Knockoff+的有限样本FDR保证。 在预定q ∈ ( 0 , 1 ) 处选择S ^ ,满足
成 立 (3) E [ | S ^ ∩ H 0 | | S ^ | ∨ 1 ] ≤ q , H 0 = { j : H j 成立 } . 该期望同时平均原观测和替身随机性。正确的协变量核负责校准,统计量的预测能力主要影响功效;任意强预测器都不能修复错误的复制核。
直觉
在知道其余协变量后,一个真零变量没有额外响应信息。合法替身模仿它与其他变量的联合关系,并且没有偷看响应。交换这一对后,连响应一起观察也应看不出区别,于是竞争分数没有偏向原变量的理由。
“模型X”的名字强调模型责任放在协变量联合律上。它允许很复杂的响应机制,却不是完全无分布假设的方法。在未知P X 时,估计它是额外工作;估计误差不会因为响应模型任意而消失。
固定设计构造 理路 固定设计 Knockoff 构造 Fixed-design knockoffs · Fixed-X knockoffs · 固定设计替身变量 在固定满秩正态线性模型中以精确Gram约束构造替身列,并由充分性及反对称性导出零坐标的联合符号公平性。 将设计视为确定输入,用响应正态性和充分统计量交换获得分数对称。本页直接让增广协变量与响应的完整联合分布在真零交换下不变,所以不需要限制分数只依赖Gram。这两条证明从不同的概率模型出发。
例子与边界
已知高斯协变量的可执行生成
令总体列向量X ∼ N p ( μ , Σ ) ,真实μ , Σ 已知且Σ ≻ 0 。预先选固定对角D ⪰ 0 、2 Σ − D ⪰ 0 ,令
(4) V = 2 D − D Σ − 1 D , X ~ = μ + ( I − D Σ − 1 ) ( X − μ ) + L Z , 其中Z ∼ N p ( 0 , I ) 独立于( X , Y ) ,L L T = V 。V 半正定时允许奇异因子。矩阵写在列向量左边;若在程序中将一行写为行向量,对应条件均值为( x − μ ) T ( I − Σ − 1 D ) + μ T ,不能颠倒乘法顺序。
证明合法性要检查整个块协方差。由联合正态的仿射构造 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ,
(5) Cov ( X X ~ ) = ( Σ Σ − D Σ − D Σ ) =: G . 其中Cov ( X , X ~ ) = Σ ( I − Σ − 1 D ) = Σ − D ;替身协方差展开为Σ − 2 D + D Σ − 1 D + V = Σ 。两块均值都为μ 。D 对角使任何逐对交换保持全部均值和协方差不变,从而保持联合高斯律。生成噪声不看Y ,第二条也成立。
式(4)中V 可用半正定二次型 理路 正定与半正定矩阵 Positive definite matrix · Positive semidefinite matrix · PSD matrix 由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。 认证:置H = Σ − 1 / 2 D Σ − 1 / 2 ,0 ⪯ H ⪯ 2 I ,所以V = Σ 1 / 2 ( 2 H − H 2 ) Σ 1 / 2 ⪰ 0 。这同时检查了噪声协方差确实存在。
例如
Σ = ( 1 3 / 5 3 / 5 1 ) , D = 16 25 I , I − D Σ − 1 = ( 0 3 / 5 3 / 5 0 ) , V = 16 25 Σ . 取μ = 0 ,一行原数据x = ( 1 , 2 ) T 给替身条件均值( 6 / 5 , 3 / 5 ) T 。再加协方差V 的新高斯噪声,不是把这份条件均值本身当作替身。逐行应用这套总体构造时,即使n = 1 也定义良好;它不需要样本Gram可逆。
独立复制整个向量为何仍可能错
令U , V 为独立公平比特,取
(6) X = ( U , U , U ) , Y = U , X ~ = ( V , V , V ) . 复制向量的边缘律与X 完全相同,且给定X 后确实与Y 独立。然而它不满足逐对交换:原来的第一、二坐标总相等,交换第一对后变为( V , U ) ,有一半概率不同。
三个条件零假设却全成立。因为给定另外两个坐标就已确定U ,X j 和Y 都是已知常量,所以条件独立。取反对称分数
W j = 1 { X j = Y } − 1 { X ~ j = Y } . 当U ≠ V 时三个分数全为1,当U = V 时全为0。以q = 1 / 3 作Knockoff+,前一种选择全部、后一种不选,FDR为1 / 2 > 1 / 3 。这里失败的是逐对交换条件,不能把责任推给分数不反对称。
这个退化协变量模型还说明:每个坐标给定其余坐标都无额外信息,不代表Y 与整个X 独立。不要未经额外条件就把式(1)的真零集合解释为唯一的最小预测变量集。对于本例,任何合法逐对交换的复制都必须满足X ~ j = U 几乎处处,因为交换后的原向量仍须落在三个坐标相等的支撑上。精确复制因此没有功效,这是目标在完全冗余变量上的真实限制。
估计总体律需要另付误差预算
若把Σ ^ 代入式(4),得到的联合律一般不满足相对于真实Σ 的式(5)。即使Σ ^ 来自独立的未标注数据,条件于估计值后也不能把错误协方差变成正确协方差。模型拟合得好可以是实证依据,不能直接宣称式(3)精确成立。
同样,边缘分布拟合正确并不证明联合逐对交换;给替身额外使用Y 也可能违反第二条。只在已知真实核的合同下使用本页有限保证,近似核需另外报告误差理论或明确缺少精确认证。
推论与应用
单个真零交换保留完整观测律
用核写法可避免假设联合密度存在。记Z = ( X , X ~ ) 、其分布为μ Z ,响应条件核为K ( X , d y ) 。第二条使( Z , Y ) 的联合律为μ Z ( d z ) K ( x , d y ) 。
若H j 成立,存在只依赖x − j 的核K j ,使K ( X , ⋅ ) = K j ( X − j , ⋅ ) 几乎处处。交换第j 对不改动X − j 。同时μ Z 在此交换下不变,故对任意有界可测测试函数h ,
(7) E [ h ( Z swap ( j ) , Y ) ] = ∫ h ( z swap ( j ) , y ) K j ( x − j , d y ) μ Z ( d z ) = ∫ h ( z , y ) K j ( x − j , d y ) μ Z ( d z ) = E [ h ( Z , Y ) ] . 交换不变也保证原核等式的零测例外不会在变换后取得正概率。标准Borel假设使所需正则条件核可用。逐个应用式(7),任意真零子集的同时交换都保留完整联合律;独立行乘积将结论传给整份数据。
从交换群到公平符号
反对称统计量把每个真零列交换变成相应分数变号。给定全部绝对值与非零假设分数后,这些量自身不受真零翻转影响,因此条件符号分布仍在所有真零翻转下不变。对于m 个非零真零坐标,任意两种符号向量可由一次子集翻转互相到达,故每种概率相同,均为2 − m 。这给出Knockoff+所需的相互独立公平符号,再由其阈值定理得到式(3)。
如果用可交换的两套变量重要性Z j , Z ~ j ,取W j = Z j − Z ~ j 就是一个接口。但“重要性可交换”要检查整个拟合流程:固定的列编号优先规则、只对原列调参或某个非对称的最优解选择,都可能破坏它。可以在确定性种子下逐对交换输入并检查输出恒等式;有限测试只能发现错误,完整保证仍来自算法设计的等变性证明。
成本与单项检验的分工
已知稠密高斯参数时,先求解线性系统并分解p × p 的V ,预处理成本为O ( p 3 ) ;对n 行求条件均值并施加噪声因子,成本O ( n p 2 ) ,保存数据与因子为O ( n p + p 2 ) 。一般协变量核的抽样成本另计,不存在由“Model-X”这个名称自动提供的通用高效抽样器。
条件随机化检验 理路 条件随机化检验 Conditional randomization test · CRT for conditional independence · 条件协变量重抽样检验 从已知协变量条件律重抽样单列,以统一评分和有限加一秩检验条件独立,并分清均匀洗牌、冻结拟合及随意停机的失效边界。 也消费已知协变量条件律,但它为某一项假设生成多次条件参考分数,输出一个校准p值。本页生成一套逐对联合可交换替身后,以符号结构控制整个选择集。两个流程对复制的要求、计算次数和输出保证不同,不能只把复制次数从一次改成多次就交换定理。
参考资料