Skip to content

方法Method

选择后推断与截断正态校准

Post-selection inference · Selective inference · 选择性推断

在同一观测先被筛选再用于推断时,按选择事件重算零分布,并由截断正态枢轴得到条件有效的检验和区间。

形式陈述 ​

只把显得有信号的结果拿出来报告,会改变报告对象的抽样分布。选择后推断把筛选规则写入概率模型,再针对通过筛选的实验校准错误率。本页固定一个可以从头算完的情形:只在正态观测超过已知门槛时报告同一个观测。

选择事件与条件分布 ​

设 Z∼N(μ,1),未知均值 μ∈R,方差已知。记标准正态分布的密度、分布函数和右尾函数为 ϕ,Φ,Q=1−Φ。在看数据前固定有限门槛 c,仅当

S={Z>c}

发生时报告。每个有限 μ 下都有 Pμ(S)=Q(c−μ)>0,因此这里使用普通正概率事件的条件概率即可。

条件于通过筛选,Z 的密度与分布函数为

fμc(z)=ϕ(z−μ)Q(c−μ)1{z>c},Fμc(z)=Φ(z−μ)−Φ(c−μ)Q(c−μ)=1−Q(z−μ)Q(c−μ),z>c.

分母把剩下的概率质量重新归一化。它依赖候选均值 μ,不能在反演区间时固定成某个估计值。

条件有效的 p 值与置信区间 ​

检验 H0:μ=μ0 对右侧备择,定义选择后的p 值

psel(z;μ0)=Pμ0(Z≥z∣Z>c)=Q(z−μ0)Q(c−μ0).

其零分布在选择条件下恰好均匀:对 0≤u≤1,

Pμ0{psel(Z;μ0)≤u∣S}=u.

若需要双侧等尾推断,定义 p2=2min{Fμ0c(z),1−Fμ0c(z)},按 p2<α 拒绝,再由置信集合与检验的对偶反演:

Cα(z)={μ:α2≤Fμc(z)≤1−α2},0<α<1.

于是对每个 μ,

Pμ{μ∈Cα(Z)∣Z>c}=1−α.

这项保证评价的是通过筛选后实际报告的区间。筛选失败时没有该报告;不能把条件错误率和全部实验中“既报告又出错”的概率当成同一个量。

直觉

在全部实验中罕见的数值,在已经限定为“大于门槛”的实验中未必同样罕见。例如,只留下正数以后,右尾区域的相对质量就翻倍了。选择校准既没有改动观测,也没有给未知参数添加先验;它改变的是比较观测时使用的参照分布。

尾部证据相对于被保留的概率质量校准

选择事件必须对应实际使用的筛选规则。如果先看结果再决定门槛或方向,真实事件就不再只是一个预先固定的 Z>c,上面的分母也不再完整描述选择过程。

例子与边界

同一个 1.96,单侧证据怎样变化 ​

取 c=0、μ0=0,观察到 z=1.96。未考虑选择的单侧 p 值是 Q(1.96)≈0.024998;条件于 Z>0 后,

psel=Q(1.96)Q(0)≈0.049996.

差异来自分母 1/2,并不是简单地因为“做了两个检验”。若只在正结果中使用原来的 0.05 单侧阈值,条件第一类错误率为 0.05/(1/2)=0.10。改用选择 p 值则恢复 0.05 的条件校准。

同一数据下,选择后的双侧等尾 p 值约为 0.099992;它不等于上述单侧值。用双侧检验反演得到的 95% 区间约为

C0.05(1.96)=[−0.436154, 3.919224].

端点分别满足 F−0.4361540(1.96)≈0.975 与 F3.9192240(1.96)≈0.025,因此零仍在区间内。知道数据已经为正以后,一个正观测对正均值的证据比未筛选时弱;区间不必以观测值对称。数字 1.96 是分位数的近似,只有用 Φ−1(0.975) 时上述单侧 p 值才恰为 0.05。

普通区间的条件覆盖要实际计算 ​

令 a=Φ−1(0.975)。普通区间 [Z−a,Z+a] 在未筛选时对每个均值均有 95% 覆盖。若 μ=0 且只在 Z>1 时报告,它包含零恰好要求 1<Z≤a,所以条件覆盖为

Φ(a)−Φ(1)1−Φ(1)≈0.842426.

这一筛选使普通区间的报告内覆盖降到约 84.2%。也并非每个选择事件在每个参数点都会使同一指标失效:当 c=0,μ=0 时,正负两侧对称,普通双侧区间的条件覆盖碰巧仍为 95%。这项单点相等不能代替对所有 μ 的条件保证。

条件校准为什么成立 ​

固定 μ0,Fμ0c 在 (c,∞) 上连续严格递增,值域为 (0,1)。对 u∈(0,1),令 zu 是满足 Fμ0c(zu)=u 的唯一数,则

Pμ0{Fμ0c(Z)≤u∣S}=Pμ0(Z≤zu∣S)=u.

因此该 CDF 值均匀,其一减也均匀,得到单侧 p 值结论。对真均值 μ 使用同样的结论,又有

Pμ{α2≤Fμc(Z)≤1−α2∣S}=1−α,

正好就是反演区间的覆盖。证明只需要这个条件分布内的对称校准,不需要对所有候选均值的错误概率作并集。

相比之下,普通单侧值 pnaive=Q(Z−μ0) 在未选择时均匀,而事件 S 等价于 pnaive<Q(c−μ0)。所以

Pμ0(pnaive≤u∣S)=min{uQ(c−μ0),1}.

这条精确分布解释了失效的来源,也直接推导出需要除以哪一份选择概率。

反演为何给出一个区间,怎样算端点 ​

固定观测 z>c,需要理解 Fμc(z) 随候选均值怎样变化。取 μ2>μ1,两条条件密度的比为正常数乘 exp⁡{(μ2−μ1)x},严格随 x 增加。因此对 c<x<z<y,

fμ1c(x)fμ2c(y)>fμ2c(x)fμ1c(y).

在 x∈(c,z)、y∈(z,∞) 上积分,得到

Fμ1c(z){1−Fμ2c(z)}>Fμ2c(z){1−Fμ1c(z)},

消去相同乘积后可知 Fμ1c(z)>Fμ2c(z)。所以 CDF 关于均值严格递减。

它还连续,且 μ→+∞ 时趋零。反方向令 s=c−μ、d=z−c>0,由正态尾积分换元,

Q(s+d)=∫s∞ϕ(u+d)du≤e−sd−d2/2Q(s).

当 μ→−∞ 时 s→∞,故 Q(s+d)/Q(s)→0,于是 Fμc(z)→1。连续性、严格单调与两端极限保证唯一有限的 L<U 满足

FLc(z)=1−α/2,FUc(z)=α/2,Cα(z)=[L,U].

计算时可对每个方程先扩展左右搜索界,直到函数值夹住所需概率,再作二分。远尾区域应使用稳定的正态右尾或对数右尾计算,避免直接相减两个接近一的 CDF。求根算法的数值容差与统计上的精确覆盖属于不同层次。

推论与应用

独立拆分改变的是数据依赖 ​

若有独立的 Z1,Z2∼N(μ,1),只用 Z1>c 决定报告,再只用 Z2 推断,则 Z2∣{Z1>c} 仍服从 N(μ,1)。普通正态校准可以继续使用,因为选择没有改变推断数据的分布。

若把 Z1 再并入估计,独立拆分的这一步论证便不再适用,需要明确利用其选择条件。拆分方案用数据隔离换取简单校准,条件推断则直接分析被重用数据的选择分布;具体精度还要按所用程序比较。

与多重检验的接口 ​

选择条件错误率关注一个指定报告事件内的推断;族错误率关注一组检验至少犯一次错误的概率。逐项选择校准并不自动控制整族错误,普通联合错误控制也不自动保证每个选择事件内的条件错误率。需要同时满足两种任务时,要说明各自控制的事件与概率。

在回归中,选择事件可能由多个变量共同决定,推断目标也可能随选中的模型改变。Lee 等论文将一类多面体选择事件转成截断正态枢轴;这需要推导实际选择约束,不能只把本页的 c 换成某个经验门槛。方差未知、阈值由同一数据估计或选择规则未记录时,也需要重新建立相应分布。

自测 ​

在零假设下,若某个预先固定的右尾筛选保留概率为 0.2,一个被保留观测的普通右尾 p 值为 0.01,选择 p 值是多少?答案为 0.01/0.2=0.05。若仍对所有被保留结果使用普通 0.05 阈值,条件第一类错误率为 0.05/0.2=0.25;这两个计算都针对同一方向的右尾筛选。

参考资料
  • Jason D. Lee, Dennis L. Sun, Yuekai Sun, and Jonathan E. Taylor, “Exact post-selection inference, with application to the lasso”, The Annals of Statistics 44(3), 2016, pp. 907–927。§5.1 Theorem 5.2、式 (5.8)–(5.9) 给出截断正态条件枢轴;§6 式 (6.1)、Theorem 6.1 为区间反演;附录 Lemma A.1 证明关于均值的单调性。
  • William Fithian, Dennis Sun, and Jonathan Taylor, “Optimal Inference After Model Selection”, arXiv:1410.2597v4, 2017 年稿,§§2.2、2.4 的选择条件错误率与检验反演,§3.2 Example 3 的样本拆分与数据重用。本文数值区间采用等尾反演,不采用该文 Figure 3 的 UMPU 区间。
关系图谱13 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组