形式陈述
只把显得有信号的结果拿出来报告,会改变报告对象的抽样分布。选择后推断把筛选规则写入概率模型,再针对通过筛选的实验校准错误率。本页固定一个可以从头算完的情形:只在正态观测超过已知门槛时报告同一个观测。
选择事件与条件分布
设 Z ∼ N ( μ , 1 ) ,未知均值 μ ∈ R ,方差已知。记标准正态分布 公理库 正态分布 Normal distribution · Gaussian distribution · 高斯分布 具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。 的密度、分布函数和右尾函数为 ϕ , Φ , Q = 1 − Φ 。在看数据前固定有限门槛 c ,仅当
S = { Z > c } 发生时报告。每个有限 μ 下都有 P μ ( S ) = Q ( c − μ ) > 0 ,因此这里使用普通正概率事件的条件概率 公理库 条件概率 Conditional probability 在已知正概率事件发生后,把交集概率重新规范到该事件内部。 即可。
条件于通过筛选,Z 的密度与分布函数为
f μ c ( z ) = ϕ ( z − μ ) Q ( c − μ ) 1 { z > c } , F μ c ( z ) = Φ ( z − μ ) − Φ ( c − μ ) Q ( c − μ ) = 1 − Q ( z − μ ) Q ( c − μ ) , z > c . 分母把剩下的概率质量重新归一化。它依赖候选均值 μ ,不能在反演区间时固定成某个估计值。
条件有效的 p 值与置信区间
检验 H 0 : μ = μ 0 对右侧备择,定义选择后的p 值 公理库 p 值 p-value 在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。
p sel ( z ; μ 0 ) = P μ 0 ( Z ≥ z ∣ Z > c ) = Q ( z − μ 0 ) Q ( c − μ 0 ) . 其零分布在选择条件下恰好均匀:对 0 ≤ u ≤ 1 ,
P μ 0 { p sel ( Z ; μ 0 ) ≤ u ∣ S } = u . 若需要双侧等尾推断,定义 p 2 = 2 min { F μ 0 c ( z ) , 1 − F μ 0 c ( z ) } ,按 p 2 < α 拒绝,再由置信集合与检验的对偶 公理库 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 反演:
C α ( z ) = { μ : α 2 ≤ F μ c ( z ) ≤ 1 − α 2 } , 0 < α < 1. 于是对每个 μ ,
P μ { μ ∈ C α ( Z ) ∣ Z > c } = 1 − α . 这项保证评价的是通过筛选后实际报告的区间。筛选失败时没有该报告;不能把条件错误率和全部实验中“既报告又出错”的概率当成同一个量。
直觉
在全部实验中罕见的数值,在已经限定为“大于门槛”的实验中未必同样罕见。例如,只留下正数以后,右尾区域的相对质量就翻倍了。选择校准既没有改动观测,也没有给未知参数添加先验;它改变的是比较观测时使用的参照分布。
图片加载失败 尾部证据相对于被保留的概率质量校准 选择事件必须对应实际使用的筛选规则。如果先看结果再决定门槛或方向,真实事件就不再只是一个预先固定的 Z > c ,上面的分母也不再完整描述选择过程。
例子与边界
同一个 1.96,单侧证据怎样变化
取 c = 0 、μ 0 = 0 ,观察到 z = 1.96 。未考虑选择的单侧 p 值是 Q ( 1.96 ) ≈ 0.024998 ;条件于 Z > 0 后,
p sel = Q ( 1.96 ) Q ( 0 ) ≈ 0.049996 . 差异来自分母 1 / 2 ,并不是简单地因为“做了两个检验”。若只在正结果中使用原来的 0.05 单侧阈值,条件第一类错误率为 0.05 / ( 1 / 2 ) = 0.10 。改用选择 p 值则恢复 0.05 的条件校准。
同一数据下,选择后的双侧等尾 p 值约为 0.099992 ;它不等于上述单侧值。用双侧检验反演得到的 95 % 区间约为
C 0.05 ( 1.96 ) = [ − 0.436154 , 3.919224 ] . 端点分别满足 F − 0.436154 0 ( 1.96 ) ≈ 0.975 与 F 3.919224 0 ( 1.96 ) ≈ 0.025 ,因此零仍在区间内。知道数据已经为正以后,一个正观测对正均值的证据比未筛选时弱;区间不必以观测值对称。数字 1.96 是分位数的近似,只有用 Φ − 1 ( 0.975 ) 时上述单侧 p 值才恰为 0.05 。
普通区间的条件覆盖要实际计算
令 a = Φ − 1 ( 0.975 ) 。普通区间 [ Z − a , Z + a ] 在未筛选时对每个均值均有 95 % 覆盖。若 μ = 0 且只在 Z > 1 时报告,它包含零恰好要求 1 < Z ≤ a ,所以条件覆盖为
Φ ( a ) − Φ ( 1 ) 1 − Φ ( 1 ) ≈ 0.842426 . 这一筛选使普通区间的报告内覆盖降到约 84.2 % 。也并非每个选择事件在每个参数点都会使同一指标失效:当 c = 0 , μ = 0 时,正负两侧对称,普通双侧区间的条件覆盖碰巧仍为 95 % 。这项单点相等不能代替对所有 μ 的条件保证。
条件校准为什么成立
固定 μ 0 ,F μ 0 c 在 ( c , ∞ ) 上连续严格递增,值域为 ( 0 , 1 ) 。对 u ∈ ( 0 , 1 ) ,令 z u 是满足 F μ 0 c ( z u ) = u 的唯一数,则
P μ 0 { F μ 0 c ( Z ) ≤ u ∣ S } = P μ 0 ( Z ≤ z u ∣ S ) = u . 因此该 CDF 值均匀,其一减也均匀,得到单侧 p 值结论。对真均值 μ 使用同样的结论,又有
P μ { α 2 ≤ F μ c ( Z ) ≤ 1 − α 2 ∣ S } = 1 − α , 正好就是反演区间的覆盖。证明只需要这个条件分布内的对称校准,不需要对所有候选均值的错误概率作并集。
相比之下,普通单侧值 p naive = Q ( Z − μ 0 ) 在未选择时均匀,而事件 S 等价于 p naive < Q ( c − μ 0 ) 。所以
P μ 0 ( p naive ≤ u ∣ S ) = min { u Q ( c − μ 0 ) , 1 } . 这条精确分布解释了失效的来源,也直接推导出需要除以哪一份选择概率。
反演为何给出一个区间,怎样算端点
固定观测 z > c ,需要理解 F μ c ( z ) 随候选均值怎样变化。取 μ 2 > μ 1 ,两条条件密度的比为正常数乘 exp { ( μ 2 − μ 1 ) x } ,严格随 x 增加。因此对 c < x < z < y ,
f μ 1 c ( x ) f μ 2 c ( y ) > f μ 2 c ( x ) f μ 1 c ( y ) . 在 x ∈ ( c , z ) 、y ∈ ( z , ∞ ) 上积分,得到
F μ 1 c ( z ) { 1 − F μ 2 c ( z ) } > F μ 2 c ( z ) { 1 − F μ 1 c ( z ) } , 消去相同乘积后可知 F μ 1 c ( z ) > F μ 2 c ( z ) 。所以 CDF 关于均值严格递减。
它还连续,且 μ → + ∞ 时趋零。反方向令 s = c − μ 、d = z − c > 0 ,由正态尾积分换元,
Q ( s + d ) = ∫ s ∞ ϕ ( u + d ) d u ≤ e − s d − d 2 / 2 Q ( s ) . 当 μ → − ∞ 时 s → ∞ ,故 Q ( s + d ) / Q ( s ) → 0 ,于是 F μ c ( z ) → 1 。连续性、严格单调与两端极限保证唯一有限的 L < U 满足
F L c ( z ) = 1 − α / 2 , F U c ( z ) = α / 2 , C α ( z ) = [ L , U ] . 计算时可对每个方程先扩展左右搜索界,直到函数值夹住所需概率,再作二分。远尾区域应使用稳定的正态右尾或对数右尾计算,避免直接相减两个接近一的 CDF。求根算法的数值容差与统计上的精确覆盖属于不同层次。
推论与应用
独立拆分改变的是数据依赖
若有独立的 Z 1 , Z 2 ∼ N ( μ , 1 ) ,只用 Z 1 > c 决定报告,再只用 Z 2 推断,则 Z 2 ∣ { Z 1 > c } 仍服从 N ( μ , 1 ) 。普通正态校准可以继续使用,因为选择没有改变推断数据的分布。
若把 Z 1 再并入估计,独立拆分的这一步论证便不再适用,需要明确利用其选择条件。拆分方案用数据隔离换取简单校准,条件推断则直接分析被重用数据的选择分布;具体精度还要按所用程序比较。
与多重检验的接口
选择条件错误率关注一个指定报告事件内的推断;族错误率 公理库 多重检验与族错误率 Multiple testing · Familywise error rate · FWER 同时检验多个假设时至少一次错误拒绝的概率及其 Bonferroni、Holm 控制。 关注一组检验至少犯一次错误的概率。逐项选择校准并不自动控制整族错误,普通联合错误控制也不自动保证每个选择事件内的条件错误率。需要同时满足两种任务时,要说明各自控制的事件与概率。
在回归中,选择事件可能由多个变量共同决定,推断目标也可能随选中的模型改变。Lee 等论文将一类多面体选择事件转成截断正态枢轴;这需要推导实际选择约束,不能只把本页的 c 换成某个经验门槛。方差未知、阈值由同一数据估计或选择规则未记录时,也需要重新建立相应分布。
自测
在零假设下,若某个预先固定的右尾筛选保留概率为 0.2 ,一个被保留观测的普通右尾 p 值为 0.01 ,选择 p 值是多少?答案为 0.01 / 0.2 = 0.05 。若仍对所有被保留结果使用普通 0.05 阈值,条件第一类错误率为 0.05 / 0.2 = 0.25 ;这两个计算都针对同一方向的右尾筛选。
参考资料
Jason D. Lee, Dennis L. Sun, Yuekai Sun, and Jonathan E. Taylor, “Exact post-selection inference, with application to the lasso” , The Annals of Statistics 44(3), 2016, pp. 907–927。§5.1 Theorem 5.2、式 (5.8)–(5.9) 给出截断正态条件枢轴;§6 式 (6.1)、Theorem 6.1 为区间反演;附录 Lemma A.1 证明关于均值的单调性。
William Fithian, Dennis Sun, and Jonathan Taylor, “Optimal Inference After Model Selection” , arXiv:1410.2597v4, 2017 年稿,§§2.2、2.4 的选择条件错误率与检验反演,§3.2 Example 3 的样本拆分与数据重用。本文数值区间采用等尾反演,不采用该文 Figure 3 的 UMPU 区间。