Skip to content

方法Method

条件随机化检验

Conditional randomization test · CRT for conditional independence · 条件协变量重抽样检验

从已知协变量条件律重抽样单列,以统一评分和有限加一秩检验条件独立,并分清均匀洗牌、冻结拟合及随意停机的失效边界。

形式陈述 ​

参考分布由哪一份知识提供 ​

观测n≥1份IID数据(Xi,Yi),其中Xi∈Rp,Yi取值于标准Borel空间。预先指定一个坐标j,已知真实条件协变量核

Qj(dxj∣x−j)=P(Xj∈dxj∣X−j=x−j).

目标零假设是

(1)Hj:Y⊥Xj∣X−j.

条件独立保证在给定其余变量后,响应不再改变被检验坐标的规律。响应本身可以二元、离散或连续,不必规定回归函数。核必须是相对于真实总体的条件律,不能只要求一个估计模型能拟合观察数据。

记被检验数据列为xj(0),背景为B=(X−j,y)。固定整数M≥1,条件于B,独立生成M列

(2)xj(b)∼⨂i=1nQj(⋅∣Xi,−j),b=1,…,M.

新随机数独立于原观测。将各列分别放回其余列不变的矩阵,应用同一个预先规定的可测评分规则T(⋅,B),得到T0,T1,…,TM,大值表示对零假设更不利。规则可以在每份矩阵上重新拟合模型;“同一个规则”不要求拟合出的参数相同。

输出

(3)p^=1+∑b=1M1{Tb≥T0}M+1.

在Hj下,对几乎处处的背景B和每个α∈[0,1],

(4)P{p^≤α∣B}≤α.

因此拒绝规则p^≤α有无条件level不超过α。式(4)的概率仍平均原来的被检验列和模拟随机性;它不是说固定整份数据后每次Monte Carlo结果都等于完整条件尾概率。

M可以事先固定,也可以只由背景B确定;后者在条件化后仍是固定整数。根据观察到的T0或模拟结果随意增加、丢弃或重复批次,则需要另一套停机校准,不能直接套式(4)。

直觉

把其余协变量和响应保留不动,问:“如果这一列在给定背景后确实不携带额外响应信息,它还会怎样变化?”已知条件核给出合法的替代列。原列与这些列在零假设下具有同样地位,于是原分数的相对秩可以校准。

条件化不是把所有变化都消掉,而是保留背景已解释的关联。某个协变量与响应在边缘上高度吻合,也可能完全由另一个变量解释;这时复制列仍应该保留这种吻合频率。把整列随便洗牌可能恰好破坏了应当保留的结构。

本页与置换检验共享秩思想,参考分布却不必来自一个均匀的有限置换轨道。它也不假设观察研究真的随机分配过该变量;这里的随机化是模型提供的条件模拟,不能由此直接推出因果解释。

例子与边界

背景使正确参考远离均匀洗牌 ​

设各行独立,Z∼Bernoulli(1/2),Y=Z;给定Z后,P(X=Z∣Z)=9/10。因为Y在给定Z后已经确定,Y⊥X∣Z成立,虽然X与Y边缘上通常相同。

在四行中观测到z=y=(0,0,1,1)、x=z。取评分T(x,z)=∑i=141{xi=zi},当前T0=4。正确条件参考给每行独立的匹配概率9/10,所以完整尾概率为

(5)pfull=P(T∗≥4∣z,y)=(910)4=656110000.

若误把两个0与两个1在四个位置均匀重排,六种不同列中只有一种全匹配,就会报告1/6。在α=1/5处它拒绝,而仅“原列全匹配”这一个事件的条件概率已是6561/10000>1/5。

失败也会体现在无条件level:四行Z恰有两个1的概率为(42)/16=3/8;在这六种背景下,全匹配都触发错误拒绝。因此该均匀置换规则的总体错误概率至少为

38(910)4=1968380000>15.

增加洗牌次数不能修复这个问题,因为错的是参考律。正确有限枚举应给每个x∈{0,1}4质量(9/10)T(x,z)(1/10)4−T(x,z),而非给六种列相同权重。

分辨率与并列 ​

式(3)的最小值是1/(M+1)。按“≤α”拒绝、目标α=1/20时,至少需要M=19才可能拒绝;这只保证网格允许拒绝,不保证具有足够功效。模拟分数与原分数并列时计入分子,所有分数相同则p^=1。

例如M=9、原分数4,模拟分数为(4,4,3,4,2,3,4,4,3),五份达到原分数,故p^=6/10。它不同于式(5)的完整尾概率,但只要这些分数确由合法独立条件模拟产生,有限秩规则本身仍有式(4)的校准。

冻结一次不对称拟合可以使错误率为一 ​

取n=p=1,X∼Uniform(0,1),Y与X独立。用观察值x0“训练”记忆函数h(v)=1{v=x0},原分数设为h(x0)=1,随后固定h给连续重抽样值评分。所有模拟分数几乎必然为零,于是M=19时p^=1/20,在5%水平下总是拒绝一个真零假设。

问题不是模型太复杂,而是原列被用于挑选h,复制列没有经历同一个流程。如果每份输入都重新运行同一记忆式训练,再在自己的训练点评分,则全部分数都为1,p值为1,校准恢复但没有功效。另一种合法办法是使用与当前样本独立的外部训练资料;条件于外部资料后,评分对全部列相同。

随机拟合也要保持对称:各份数据使用同分布独立种子,或使用一份独立共同种子且条件于它仍为相同函数,都可建立可交换性。只为原列多试几个种子、选最好结果再与单次复制比较,则没有这项保证。

推论与应用

先证明列的条件同分布,再证明秩 ​

在Hj下,正则条件核满足

L(Xj∣X−j,Y)=L(Xj∣X−j)=Qj(⋅∣X−j)

几乎处处。IID行使给定B后的原列服从式(2)的乘积核。原列与M个新列因此条件IID;应用同一评分函数,得到条件可交换分数T0,…,TM。

令N=M+1。对任意已经固定的分数向量,定义每个位置的保守大值秩

Ri=#{b∈{0,…,M}:Tb≥Ti}.

对每个整数k,至多有k个位置满足Ri≤k。证明可按分数由大到小分组:一个并列组的R值是截至该组的总位置数,若它超过k,则该组及后续组均不合格;若不超过k,已合格的位置总数就不超过k。

用可交换性把各位置的概率平均,并注意p^=R0/N,便得到

(6)P(p^≤α∣B)=1NE[#{i:Ri≤⌊αN⌋}∣B]≤⌊αN⌋N≤α.

这直接验证式(3)是一项超均匀p值,并完整包含离散分数与并列。给背景再取期望即可得到无条件level。

预算与评分流程都是算法输入 ​

合法实现可以逐列生成:保存T0和超过计数,模拟一列、重算T、更新计数,最后输出加一比例。若一行条件抽样成本为CQ、一次完整评分成本为CT,总成本为O(MnCQ+(M+1)CT);除原数据和评分器自身所需空间外,重抽样仅需O(n)列缓冲和常数计数空间。若每次T都要重新训练大模型,这部分成本不能被省略成“只生成M列”。

一个错误的停止规则是:保留同一个连续原分数T0,每次只抽一个参考分数,直到首次Tb<T0,便丢弃先前失败批次并报告p=1/2。若全部分数在真零下IID Uniform(0,1),条件于T0=t∈(0,1),每次成功概率t,所以这项规则几乎必然停机,最终以概率1报告p=1/2。在α=1/2处错误率为1。有限加一公式不允许这样选择所报告的那次模拟。

单项有效不自动解决全部选择问题 ​

对多个j分别运行CRT,会得到各自有效的边缘p值;这些p值一般相互依赖。是否能使用普通BH,应另核其依赖条件,不能从各项式(4)直接推出。已有任意依赖多重检验规则可按自己的合同组合这些p值;那是额外的选择步骤。

图左采用完整终点中不同背景概率的四行模型,并进一步条件于总数为二;每种允许列仍需保留自己的权重。图右则对四个真零符号反复作Knockoff+,最后挑有发现的一次:单次合法并不自动校准这个额外选择。两边分别改变了参考条件与报告流程。

Model-X Knockoff改为构造一套在各原/替身对之间联合可交换的数据,再以符号阈值直接控制整个选择集。CRT只需被检验单列的真实条件核,Model-X需要一套兼容的联合复制机制。两者都能处理任意响应核,但核输入与误差输出不能混写。

参考资料
关系图谱15 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系