Skip to content

识别与选择终点:补全世界、截尾人群和偏差阈值 ​

先读部分识别、Lee选择界和配对敏感性分析。返回识别与选择学习路线。下载精确复算程序及结果JSON。

四项任务各自指定概率来自哪里。前三项先把观测总体律当成已知,求所有相容世界;第四项固定潜在结果,改变允许的分配律。除明确加入IID抽样的步骤外,数值界都不是置信区间。

任务一:不同人群拥有不同的已知支持 ​

输入与要求 ​

协变量X对所有人可见,P(X=0)=1/3、P(X=1)=2/3。X=0时结果的已知支持是[0,1],回答率1/2;X=1时支持是[0,4],回答率3/4。两层所有回答者的结果均为一,不对未回答者作任何独立性假设。

求完整总体均值的锐界,给出端点完整律;再说明为什么先忘掉X、只使用共同支持[0,4]会丢失信息。

完整答案 ​

层内均值区间分别为[1/2,1]和[3/4,7/4],按原总体层权重平均得

Θμ=[2/3,3/2].

可以用十二份等质量类型核验:四份属于X=0,两份可见且为一、两份缺失;八份属于X=1,六份可见且为一、两份缺失。下端把四份缺失都填零,总和八、均值2/3;上端把第一层两份填一、第二层两份填四,总和十八、均值3/2。两份世界保留同一个完整(X,R,RY)观测律,混合给每个中间均值。

忘掉X后,总回答率为2/3,E(RY)=2/3。只用共同支持得到[2/3,2]。被丢掉的约束是第一层未回答者不可能取四:无条件上端试图把这部分人也填成四,因此不能与原来已知支持同时成立。

再加入有限样本保护 ​

现在设独立同分布抽取n条(X,R,RY),在每条记录中按自己的已知支持计算Li=RiYi和Ui=RiYi+(1−Ri)b(Xi)。两者都在[0,4]中,故ε=4log⁡(2/α)/(2n)给出

[max(0,L―−ε), min(4,U―+ε)]

以至少1−α的概率含住整个真实识别集合。这一保证针对随机样本;上面的十二类型是总体构造,不是恰好抽到十二人就自动取得某个置信水平。

若某份n=800的样本恰有L―=2/3,U―=3/2,取α=0.05时只需按此公式增加抽样保护,不能把识别宽度5/6也除以800。

做任务二前,可先回顾条件分布:截尾使用的是处理组可见者内部归一化后的结果分布,并非这些人在原总体中的质量。恢复完整潜在人群时,要把两种质量分清;任务三还会在始终可见人群内部重新计算层权重。

任务二:从截尾质量恢复完整潜在人群 ​

输入与要求 ​

处理随机,p0=1/2,p1=3/4,选择向上单调。处理可见分布为结果零、二、六各占1/4,1/2,1/4;对照可见结果恒为一。先求界,再把低端和高端各写成总体类型质量表,核全部观测分布。

完整答案 ​

始终可见A、仅处理可见I、从不可见N的总体质量为1/2,1/4,1/4。处理可见者中保留a=2/3,两端均须把结果二的原子分开。

低端世界的非零质量为

类型 Y(1) Y(0) 总体质量
A 0 1 3/16
A 2 1 5/16
I 2 任选0 1/16
I 6 任选0 3/16
N 任选0 任选0 1/4

高端世界把第一行A的处理结果零换为六,同时把I的六换为零,其余行不变。两张表的处理可见总体质量均为:零3/16、二6/16、六3/16;除以p1=3/4就恢复指定分布。对照可见者都来自A,总质量1/2且结果为一。

在A内归一化,低端处理均值为5/4,高端为7/2,所以效应界为[1/4,5/2]。表格给出同时满足所有要求的端点世界,比只报两个截尾均值多完成了一步锐性认证。

如果保留全部Y≤2,保留比例变成3/4,而始终可见者实际只占2/3。这份错误方案在可见样本上似乎容易执行,却不再满足潜在人群的质量合同。

改变选择方向 ​

现在换一个独立实验:假设S(1)≤S(0),p1=1/2,p0=3/4。处理可见结果恒为四,对照可见分布改为刚才的零、二、六三点分布。应截尾对照,得到ν−=5/4,ν+=7/2,所以

τA∈[4−7/2,4−5/4]=[1/2,11/4].

若直接沿用“截处理、减对照”的原公式,会针对错误的混合物;若相减时不交换上下端,又会写出倒置的区间。

任务三:正确的层权重能识别出正方向 ​

输入与要求 ​

两个处理前层X=0,1各占一半,处理与X及全部潜在量独立,选择向上单调。

  • X=0:p00=1/2,p10=1;处理可见结果零、二各占一半,对照可见结果恒零
  • X=1:p01=p11=1;处理结果恒十,对照结果恒九

求始终可见人群的锐界。再忘掉X算粗Lee界,找出信息丢失在哪里。

完整答案 ​

第一层保留一半处理分布,所以层内效应界[0,2];第二层没有选择变化,效应为一。始终可见者的两层总体质量为1/4,1/2,归一化权重为1/3,2/3,因此

(1)ΘτA=[2/3,4/3].

不要按原总体权重各一半平均,那会得到[1/2,3/2],对应错误的目标人群构成。

忘掉X后p0=3/4,p1=1,处理分布为

P(Y=0)=1/4,P(Y=2)=1/4,P(Y=10)=1/2,

对照可见均值为μ0=(1/3)0+(2/3)9=6。低端保留3/4:零1/4、二1/4、十1/4,得到均值四;高端保留十1/2和二1/4,得到均值22/3。所以粗界为

(2)[−2,4/3].

粗下端试图把一半的结果十排除出A,但结果十所在的第二层始终全部可见,任何这种排除都违反已知层内选择率。条件化后这些相容世界被删掉,负效应不再可能。这是人口识别信息的加强,不是多做一次回归让标准误变小。

端点同样可构造:第二层不动;第一层从零或二中选择恰好一半作为A,剩余半数作为仅处理可见者。按两层总体权重混合,即分别达到式(1)两端。

任务四:并列、零差和候选效应必须一起更新 ​

输入与要求 ​

四个固定匹配对的处理减对照差为(0,1,1,2)。每对独立,处理概率满足同一个Γ限制。检验逐人恒定效应候选δ,使用调整差的符号计数:删除零差,每个非零差权重一,大值更反对候选。分别计算δ<0、0、(0,1)、1、(1,2)、2和>2的精确最坏上尾。

完整答案 ​

令h=Γ/(1+Γ),非零对数为m,正差数为k。每个候选重新读取调整差,得到

候选位置 m k pΓ+
δ<0 4 4 h4
δ=0 3 3 h3
0<δ<1 4 3 4h3−3h4
δ=1 2 1 2h−h2
1<δ<2 4 1 1−(1−h)4
δ=2 3 0 1
δ>2 4 0 1

在Γ=2时,七个值依次为

16/81,8/27,16/27,8/9,80/81,1,1.

取教学水平α=1/4,按p+≤α拒绝,接受集合是[0,∞)。零处的对被删除,使p从左侧的16/81跳到8/27,所以端点零保留。网格若没单独检查零,就可能误报开区间。

在真实表上检查覆盖,而不只检查一个观察 ​

固定每对两人的基线分别为(0,ai),其中a=(0,1,1,2),真实恒定效应为零。上面给出的观察对应所有非零对中较高结果者处理。现在改变所有24种分配,保持潜在表不变。

在真候选零处,始终只有三个非零对。即使三者全为正,最坏p值也为8/27>1/4,所以对这张真实表,该单侧反演程序在Γ=2下总保留零,实际覆盖为一。理论保证是至少3/4,离散程序没有必须用尽错误预算。

若换为权重(1,2,2,3)和观察正和七,精确卷积给[l3,h3];用全部端点概率向量枚举可独立核验极值。若改成双侧绝对统计量,则尾事件不再逐坐标递增,必须重新优化;不能把同一个h3当作任意双侧答案。

提交检查 ​

提交每个端点完整律或分配律,核它保持全部观测质量和假设;说明目标人群、总体还是有限表、概率源及原子处理。公开程序枚举有理补全、全部截尾顶点与隐藏分配角点,并与排序算法、卷积和候选断点交叉核验。有限枚举补充正文的一般证明,没有把有限测试提升为对任意总体律的证明。