Skip to content

方法Method

部分识别与可达锐界

Partial identification and sharp bounds · Identified set · Manski bounded-outcome bounds

从完整观测律的相容补全出发构造识别集合,证明缺失均值与无交换性ATE的可达端点,并将识别宽度与有限样本覆盖分开。

形式陈述 ​

看不见的部分还能把答案移动多远 ​

一百份问卷只有六十份回答了一个取值在零到一之间的问题,回答者均值为四分之三。把六十份回答的均值算得再精确,也没有告诉我们另外四十人的结果。可是答案也不是完全未知:若未回答者全为零,总体均值是0.45;若全为一,总体均值是0.85。这两个端点之间的每一个值,都可以来自一份与已见资料相容的完整总体。

先在总体分布层面定义这个问题。设P是完整数据W的概率律,允许模型集合为M,实际只观察O=g(W)。给定完整的观测分布Q,相容模型与目标识别集合分别为

(1)M(Q)={P∈M:P∘g−1=Q},Θ(Q)={θ(P):P∈M(Q)}.

这里比较的是所有可观测事件的概率,不是某一份样本上的相同似然。若集合是单点,目标得到点识别;有多个可能值时,可以报告整个集合。若集合为空,则该观测律与所声明模型矛盾,而不是“参数非常精确”。

含住Θ(Q)的区间叫有效界。若它恰等于Θ(Q),称为锐界:既不能向内缩,又没有把实际不可能的内部值夹进来。本文的闭区间都会逐一构造端点及内部值;一般目标的识别集合不一定是区间,也不一定达到其上、下确界。

有界缺失均值的准确集合 ​

设R∈{0,1}标记结果是否可见,已知有限常数a<b使Y∈[a,b]几乎处处。观察O=(R,RY);R=0时第二坐标只是占位的零,不能当成实际结果。除了支持限制,不假定缺失独立、MAR或任何选择模型。目标为完整总体的均值μ=E(Y)。写

p=E(R),m=E(RY).

则其识别集合恰为

(2)Θμ(Q)=[ℓ,u],ℓ=m+(1−p)a,u=m+(1−p)b.

乘积写法不需要除以p:完全没有结果可见时p=0,仍得到[a,b];全可见时p=1,集合缩成m。

直觉

证明界有效,只完成了一半 ​

逐点有

RY+(1−R)a≤Y≤RY+(1−R)b.

取期望即得式(2)的包含。也可由全期望公式写成

E(Y)=pE(Y∣R=1)+(1−p)E(Y∣R=0)

来理解,但在p=0或一时必须避免未定义的条件均值。

要证明端点真的能发生,保留R的分布和所有R=1时的Y分布,分别在R=0时把Y设为a或b。这两份完整律有同一个Q,却分别给出ℓ,u。再以概率λ选择第二份完整律、以概率1−λ选择第一份,得到的观测律仍为Q,均值为(1−λ)ℓ+λu。因此区间内没有缺口。

如果结果是二元变量,不能把每个未见结果填成0.4,但可以令未见人群中40%为一、60%为零。构造的是总体分布,不必把总体权重误当成某一份有限表的整数人数。

附加假设的作用是删除相容律 ​

若在同一个观测律Q下,将模型从M缩为M′⊆M,则

(3)ΘM′(Q)⊆ΘM(Q).

更多样本让Q估得更准;更强假设则改变哪些完整律被允许。这两种缩窄来自不同地方。若假定E(Y∣R=0)=E(Y∣R=1)且0<p<1,均值就缩成回答者均值,但这项等式涉及缺失结果,不能仅凭已有回答验证。

还要保持相容约束共同成立。例如两个识别区间分别包含一个参数,不表示它们笛卡尔积内的每个参数对都可同时实现。研究差、比或其他非线性目标时,应在同一份完整律上优化,不能任意拼接不相容的边缘端点。

例子与边界

六成回答的两个完整世界 ​

令P(R=1,Y=1)=9/20、P(R=1,Y=0)=3/20、P(R=0)=2/5。观测律给出p=3/5,m=9/20,所以

Θμ(Q)=[9/20,17/20].

下端世界把全部未回答者设为零,上端世界把他们设为一。两份世界的问卷记录分布逐项相同。把未回答者的一半设为一便得到均值13/20,同样相容。集合宽度为2/5,正好等于未回答比例乘支持宽度。

左图端点来自不同完整总体。右图固定相同经验比例,按后文式(5)显示不同样本量的保护区间;最下行才是已知观测律时的识别集合。横轴没有给均值分配后验概率。

不假定交换性时,二元处理仍有锐界 ​

在潜在结果框架下,令Y(0),Y(1)∈[0,1],观察A∈{0,1}和Y=Y(A)。不要求A独立于潜在结果。写

p=P(A=1),m1=E(AY),m0=E{(1−A)Y}.

对总体平均效应τ=E{Y(1)−Y(0)},准确集合为

(4)Θτ(Q)=[m1−m0−p, m1−m0+1−p].

下端可同时达到:对实际处理者把未见Y(0)设为一,对实际对照者把未见Y(1)设为零,所有已见结果不动。上端则交换这两种填法。两份完整律的凸混合仍遵守一致性与有界性,给出每个中间效应,所以这一次两个边缘极值确实可在同一模型内配合。

取p=1/2,处理者均值3/4、对照者均值1/4。粗差为1/2,但m1−m0=1/4,于是

Θτ(Q)=[−1/4,3/4].

下端补全产生负效应,上端产生正效应,二者有相同观测律。式(4)的宽度恒为一,而且一定包含零:因为0≤m1≤p、0≤m0≤1−p。仅凭这种有界性和观察资料,还不能确定效应符号。

支持必须是关于总体的已知信息 ​

若结果不受已知有限界约束,缺失比例为正时,可以把未见结果放到任意大的正数或负数上,使完整均值任意移动。每一份补全都可以有有限期望,却不存在统一有限锐界。将样本最小值和最大值当成总体支持,会排除完全合法的未见尾部。

识别也不同于有限表补全。例如已固定十个单位、其中四个缺失且结果二元,均值只能以1/10为步长变化;总体概率律模型下的连续区间与这个离散目标不同。必须先说明是哪个模型的相容集合。

推论与应用

为整个识别集合加上有限样本保护 ​

现在才引入抽样:O1,…,On独立同分布,仍使用事前已知a<b。每条记录可计算

Li=RiYi+(1−Ri)a,Ui=RiYi+(1−Ri)b.

其期望就是ℓ,u,两者都在[a,b]中。同一条记录的Li,Ui可以相关,不影响下面的两个单独集中界。给定事先固定0<α<1,令

(5)εn=(b−a)log⁡(2/α)2n,Cn=[max{a,L―−εn},min{b,U―+εn}].

对L―−ℓ和u−U―分别应用Hoeffding单侧界,每个失败概率至多α/2。并集界遂给出

(6)PQ{Θμ(Q)⊆Cn}≥1−α.

这是覆盖整个识别集合的共同事件,因而也覆盖任意相容完整律的真实均值。式(5)不是最短区间,但不需要估计缺失机制或使用渐近正态近似。因为L―≤U―且二者落在[a,b],区间始终非空。

即使n很大,式(5)也趋向[ℓ,u],一般不会缩成一点。计算L―,U―只需O(n)时间和O(1)累加空间;误差半径与识别宽度应分别报告。依赖记录、数据后选择支持界或反复查看直到显著,均不由这条固定样本保证覆盖。

下一步要缩的是哪种不确定性 ​

若额外了解选择如何受处理影响,Lee选择界可以换一个明确的潜在人群目标,用截尾构造更窄的识别集合。若已有配对研究,却只愿限制处理分配偏离公平币的程度,Rosenbaum敏感性分析则优化一族零假设分配律的尾概率。前者的输出是可能效应,后者的输出是最坏检验概率;两者都需要写出允许模型,不能靠“保守”二字代替证明。

参考资料
关系图谱14 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系