形式陈述
看不见的部分还能把答案移动多远
一百份问卷只有六十份回答了一个取值在零到一之间的问题,回答者均值为四分之三。把六十份回答的均值算得再精确,也没有告诉我们另外四十人的结果。可是答案也不是完全未知:若未回答者全为零,总体均值是0.45;若全为一,总体均值是0.85。这两个端点之间的每一个值,都可以来自一份与已见资料相容的完整总体。
先在总体分布层面定义这个问题。设P 是完整数据W 的概率律,允许模型集合为M ,实际只观察O = g ( W ) 。给定完整的观测分布Q ,相容模型与目标识别集合分别为
(1) M ( Q ) = { P ∈ M : P ∘ g − 1 = Q } , Θ ( Q ) = { θ ( P ) : P ∈ M ( Q ) } . 这里比较的是所有可观测事件的概率,不是某一份样本上的相同似然。若集合是单点,目标得到点识别 理路 统计模型的可识别性 Identifiability of a statistical model · Parameter identifiability 观测分布能否唯一决定参数或目标,以及对称、观测机制与弱识别造成的边界。 ;有多个可能值时,可以报告整个集合。若集合为空,则该观测律与所声明模型矛盾,而不是“参数非常精确”。
含住Θ ( Q ) 的区间叫有效界。若它恰等于Θ ( Q ) ,称为锐界 :既不能向内缩,又没有把实际不可能的内部值夹进来。本文的闭区间都会逐一构造端点及内部值;一般目标的识别集合不一定是区间,也不一定达到其上、下确界。
有界缺失均值的准确集合
设R ∈ { 0 , 1 } 标记结果是否可见,已知有限常数a < b 使Y ∈ [ a , b ] 几乎处处。观察O = ( R , R Y ) ;R = 0 时第二坐标只是占位的零,不能当成实际结果。除了支持限制,不假定缺失独立、MAR或任何选择模型。目标为完整总体的均值 理路 期望 Expectation · Expected value 实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。 μ = E ( Y ) 。写
p = E ( R ) , m = E ( R Y ) . 则其识别集合恰为
(2) Θ μ ( Q ) = [ ℓ , u ] , ℓ = m + ( 1 − p ) a , u = m + ( 1 − p ) b . 乘积写法不需要除以p :完全没有结果可见时p = 0 ,仍得到[ a , b ] ;全可见时p = 1 ,集合缩成m 。
直觉
证明界有效,只完成了一半
逐点有
R Y + ( 1 − R ) a ≤ Y ≤ R Y + ( 1 − R ) b . 取期望即得式(2)的包含。也可由全期望公式 理路 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 写成
E ( Y ) = p E ( Y ∣ R = 1 ) + ( 1 − p ) E ( Y ∣ R = 0 ) 来理解,但在p = 0 或一时必须避免未定义的条件均值。
要证明端点真的能发生,保留R 的分布和所有R = 1 时的Y 分布,分别在R = 0 时把Y 设为a 或b 。这两份完整律有同一个Q ,却分别给出ℓ , u 。再以概率λ 选择第二份完整律、以概率1 − λ 选择第一份,得到的观测律仍为Q ,均值为( 1 − λ ) ℓ + λ u 。因此区间内没有缺口。
如果结果是二元变量,不能把每个未见结果填成0.4,但可以令未见人群中40%为一、60%为零。构造的是总体分布,不必把总体权重误当成某一份有限表的整数人数。
附加假设的作用是删除相容律
若在同一个观测律Q 下,将模型从M 缩为M ′ ⊆ M ,则
(3) Θ M ′ ( Q ) ⊆ Θ M ( Q ) . 更多样本让Q 估得更准;更强假设则改变哪些完整律被允许。这两种缩窄来自不同地方。若假定E ( Y ∣ R = 0 ) = E ( Y ∣ R = 1 ) 且0 < p < 1 ,均值就缩成回答者均值,但这项等式涉及缺失结果,不能仅凭已有回答验证。
还要保持相容约束共同成立。例如两个识别区间分别包含一个参数,不表示它们笛卡尔积内的每个参数对都可同时实现。研究差、比或其他非线性目标时,应在同一份完整律上优化,不能任意拼接不相容的边缘端点。
例子与边界
六成回答的两个完整世界
令P ( R = 1 , Y = 1 ) = 9 / 20 、P ( R = 1 , Y = 0 ) = 3 / 20 、P ( R = 0 ) = 2 / 5 。观测律给出p = 3 / 5 , m = 9 / 20 ,所以
Θ μ ( Q ) = [ 9 / 20 , 17 / 20 ] . 下端世界把全部未回答者设为零,上端世界把他们设为一。两份世界的问卷记录分布逐项相同。把未回答者的一半设为一便得到均值13 / 20 ,同样相容。集合宽度为2 / 5 ,正好等于未回答比例乘支持宽度。
图片加载失败 左图端点来自不同完整总体。右图固定相同经验比例,按后文式(5)显示不同样本量的保护区间;最下行才是已知观测律时的识别集合。横轴没有给均值分配后验概率。
不假定交换性时,二元处理仍有锐界
在潜在结果框架 理路 潜在结果框架 Potential outcomes framework · Rubin causal model 用同一单位在各个明确干预下的潜在结果定义因果效应,并把观测机制与科学目标分离。 下,令Y ( 0 ) , Y ( 1 ) ∈ [ 0 , 1 ] ,观察A ∈ { 0 , 1 } 和Y = Y ( A ) 。不要求A 独立于潜在结果。写
p = P ( A = 1 ) , m 1 = E ( A Y ) , m 0 = E { ( 1 − A ) Y } . 对总体平均效应τ = E { Y ( 1 ) − Y ( 0 ) } ,准确集合为
(4) Θ τ ( Q ) = [ m 1 − m 0 − p , m 1 − m 0 + 1 − p ] . 下端可同时达到:对实际处理者把未见Y ( 0 ) 设为一,对实际对照者把未见Y ( 1 ) 设为零,所有已见结果不动。上端则交换这两种填法。两份完整律的凸混合仍遵守一致性与有界性,给出每个中间效应,所以这一次两个边缘极值确实可在同一模型内配合。
取p = 1 / 2 ,处理者均值3 / 4 、对照者均值1 / 4 。粗差为1 / 2 ,但m 1 − m 0 = 1 / 4 ,于是
Θ τ ( Q ) = [ − 1 / 4 , 3 / 4 ] . 下端补全产生负效应,上端产生正效应,二者有相同观测律。式(4)的宽度恒为一,而且一定包含零:因为0 ≤ m 1 ≤ p 、0 ≤ m 0 ≤ 1 − p 。仅凭这种有界性和观察资料,还不能确定效应符号。
支持必须是关于总体的已知信息
若结果不受已知有限界约束,缺失比例为正时,可以把未见结果放到任意大的正数或负数上,使完整均值任意移动。每一份补全都可以有有限期望,却不存在统一有限锐界。将样本最小值和最大值当成总体支持,会排除完全合法的未见尾部。
识别也不同于有限表补全。例如已固定十个单位、其中四个缺失且结果二元,均值只能以1 / 10 为步长变化;总体概率律模型下的连续区间与这个离散目标不同。必须先说明是哪个模型的相容集合。
推论与应用
为整个识别集合加上有限样本保护
现在才引入抽样:O 1 , … , O n 独立同分布,仍使用事前已知a < b 。每条记录可计算
L i = R i Y i + ( 1 − R i ) a , U i = R i Y i + ( 1 − R i ) b . 其期望就是ℓ , u ,两者都在[ a , b ] 中。同一条记录的L i , U i 可以相关,不影响下面的两个单独集中界。给定事先固定0 < α < 1 ,令
(5) ε n = ( b − a ) log ( 2 / α ) 2 n , C n = [ max { a , L ― − ε n } , min { b , U ― + ε n } ] . 对L ― − ℓ 和u − U ― 分别应用Hoeffding单侧界 理路 Hoeffding 不等式 Hoeffding's inequality 独立有界随机变量和偏离期望的概率以平方偏差的指数速度衰减。 ,每个失败概率至多α / 2 。并集界 理路 并集界 Union bound · Boole 不等式 多个坏事件中至少一个发生的概率,不超过各事件概率之和。 遂给出
(6) P Q { Θ μ ( Q ) ⊆ C n } ≥ 1 − α . 这是覆盖整个 识别集合的共同事件,因而也覆盖任意相容完整律的真实均值。式(5)不是最短区间,但不需要估计缺失机制或使用渐近正态近似。因为L ― ≤ U ― 且二者落在[ a , b ] ,区间始终非空。
即使n 很大,式(5)也趋向[ ℓ , u ] ,一般不会缩成一点。计算L ― , U ― 只需O ( n ) 时间和O ( 1 ) 累加空间;误差半径与识别宽度应分别报告。依赖记录、数据后选择支持界或反复查看直到显著,均不由这条固定样本保证覆盖。
下一步要缩的是哪种不确定性
若额外了解选择如何受处理影响,Lee选择界 理路 Lee 选择界与分数截尾 Lee selection bounds · Lee trimming bounds · 单调选择下的锐界 在随机处理和单调选择下,对始终可见人群的平均效应给出可达截尾界,保留原子分数质量,并推导条件化后的正确人群权重。 可以换一个明确的潜在人群目标,用截尾构造更窄的识别集合。若已有配对研究,却只愿限制处理分配偏离公平币的程度,Rosenbaum敏感性分析 理路 Rosenbaum 配对敏感性分析 Rosenbaum matched-pair sensitivity analysis · Gamma sensitivity bounds · 配对隐蔽偏差界 对独立匹配对的未知处理概率施加Gamma限制,证明非负固定权重单侧尾的可达最坏界,构造有效p值和精确卷积,并分清双侧与恒定效应反演的责任。 则优化一族零假设分配律的尾概率。前者的输出是可能效应,后者的输出是最坏检验概率;两者都需要写出允许模型,不能靠“保守”二字代替证明。
参考资料