一份有限拟合结果需要哪些证书
本终点从同一类二元观测出发,逐步改变设计和推断任务。先判断原MLE是否存在,再明确有限惩罚估计改变了什么;随后固定层总数消去截距,最后为共同优势比交付可复算的等尾区间。每一步都保留自己的随机模型和目标。
四个接口分别是分离与有限MLE、Firth惩罚、条件logistic模型与优势比的精确条件推断。
任务一:增加一列协变量会怎样改变存在性
四个观测的响应为y=(0,1,0,1)。首先只使用截距和协变量t,t=(−1,−1,1,1)。在两个t位置都出现了相反标签,所以非零弱分离方向不存在。β=(0,0)给每行概率1/2、得分为零,是有限唯一MLE。
现在另记录一列二元协变量c=(0,1,0,1),得到三列设计
第三列没有成为前两列的线性组合:同一t下,前两列相同而第三列不同,故秩从2增加到3。方向
这说明存在性是“资料与所选设计”共同决定的。原模型有有限解,不能推出添加协变量后仍有有限解。即使软件在两次拟合中都给出有限数字,也应分别验证设计秩和间隙证书。
准完全情形的对照
若只使用截距和t,改取t=(−1,0,0,1)、y=(0,0,1,1),则v=(0,1)给间隙(1,0,0,1)。中间两行要求截距同时严格正、严格负,排除了完全分离;弱方向又确实存在,所以是准完全分离。
沿β=(0,b)、b→∞,外侧概率趋0与1,中间两行保持1/2,对数似然趋−2log2。这给出了上确界和一条趋近路径,没有给出一个有限极大点。
任务二:两组完全分离,有限修正的目标是什么
考虑独立Bernoulli观测,设计只有截距和组指标g。g=0组有3次观测,全部失败;g=1组有2次观测,全部成功。写两组成功概率为p_0与p_1,系数为
原似然是
记
所以惩罚对数似然除常数外分解为
分别对两组logit求导,得唯一根
本例的两个组logit可以自由变化,目标各部分都严格凹,因而能够额外证明该解唯一;这不是把一般Firth目标无条件称为严格凹。
用修正得分再验一次
每个组的重复行具有相同杠杆,分别为h=1/3和h=1/2。组0修正残差之和是
组1的相应和为
乘设计后两维修正得分都为零。该有限点最大化的是加入信息惩罚后的目标;原始独立Bernoulli似然的分离方向仍存在。
任务三:从配对迁移到五候选、两成功、二维协变量
一层有5个成员,原模型是给定设计的独立Bernoulli,具有共同层截距α与二维斜率β。条件于该层恰有2个成功,令五个协变量依次为
在
允许结果是10个二人子集。按12、13、14、15、23、24、25、34、35、45排列,其重量依次为
总重量Z=95。因而观察到子集23的条件概率为6/95。子集14也产生T=(1,1),所以统计量T=(1,1)的概率为12/95;这两个概率不能混淆。
矩递推和一次上升方向
将每个子集的权重、权重乘T、权重乘TT^T分别相加,再除以95,得到
首个主元为正,且
解
由于
用公开脚本还可完全不枚举子集:对“已读成员数、已选人数”运行条件logistic页的Z、M、R递推,会得到相同的有理矩。这里状态r只能取0、1、2,加入一个成员时逆序更新,保存的是加入该成员前的三个矩状态。
哪些操作会改变模型
随机把这5人分成若干对,只允许每对至多一个成功,会删掉原本允许的子集,不能继续使用上述Z=95。忽略固定总数,把5个条件成功指示当成独立Bernoulli,也会改变联合分布。
给全部x_i加同一个二维向量则不改变条件概率:每个允许T统一增加两倍该向量,分子分母约去相同因子。相反,若只增加“整个层的类别”作为协变量,它在所有子集中都贡献固定值,不可能从这一条件实验估计其斜率。
任务四:共同优势比必须保留各层边缘
现在有两个独立层,每层各含两个独立二项组。假定两层具有同一个未知优势比θ>0,但允许其基准成功概率不同。观测表为
| 层 | 第一组:成功、失败 | 第二组:成功、失败 |
|---|---|---|
| 1 | 2、1 | 1、2 |
| 2 | 1、1 | 1、2 |
分别固定层1的总成功数3与层2的总成功数2。令A_j为第j层第一组成功数,则两个条件归一化多项式为
联合目标的充分计数T=A_1+A_2观察到3。独立层相乘、相同T合并后,
因此支持为0,…,5,系数c=(3,33,82,66,15,1),
条件估计与等尾区间
均值方程
正根唯一,给
95%等尾端点由下列两个方程给出:
解为
可用有理数逐项计算多项式,验证更明确的括界
脚本检查下端两侧右尾分别小于和大于0.025,上端两侧左尾分别大于和小于0.025。尾函数的严格单调性保证这些不等式确实认证端点,而非仅与某次数值迭代输出一致。
为何不能先把两层表相加
合并表的第一组是3成功、2失败,第二组是2成功、4失败。只固定合并成功总数5时,中央组合系数为
与保留两层边缘的c不是常数倍。两者已经是不同的条件实验,不能把合并交叉比3或合并表的区间作为上述共同θ条件推断的替代答案。
如果两层真实优势比不同,单个θ模型本身就不成立。形式上仍能将似然写成一维函数,不会因此证明共同效应存在;需要先说明采用共同参数的科学假设。
任务五:有限标准误能否保证95%覆盖
取单个Bernoulli观测Y,即n=1截距模型。Firth估计只可能为−log3与log3,信息为3/16,标准误为
两个可能区间的最大上端为
真β=6是模型允许的有限参数,真概率为σ(6)∈(0,1)。无论Y=0还是Y=1,区间上端都小于6,故覆盖概率为0。这里不需要模拟,也不需要罕见事件近似:已经枚举了完整样本空间。
这个反例解释了为什么任务四的有限样本尾反演证明不能被“估计与标准误都有限”取代。Firth有限性、固定内部参数的偏差阶数、区间覆盖,分别有不同的数学合同。
复算与交付清单
公开检查脚本与结果包含有理子集枚举和DP对照、修正得分、条件质量与尾覆盖枚举、多层卷积及端点有理括界。高精度小数仅用于展示,明确的端点区间由有理不等式认证。
完成本终点后,一份合格报告应交出:设计与随机机制;原MLE的存在性证书;若改变目标则写明惩罚;条件化时保留的总数与被消去的参数;有限支持、尾约定和端点;最后说明算法残差与统计覆盖各自依赖什么。返回本单元学习路线。