“若目标是估计两组优势比而非只检验共同成功率,可使用优势比的精确条件推断:保留相同边缘,组合质量再乘未知优势比的幂,得到完整条件族。条件MLE通常不同于样本交叉比;等尾区间反演两份单尾检验,不…”
一个二乘二表不仅能检验两组是否相同,也能估计两组成功优势之比。样本交叉乘积比、条件似然的极大点和置信区间的端点来自不同计算。把整个条件分布写出来,才能解释它们为何可以明显不同,以及稀疏表为什么需要保留零或无穷边界。
形式陈述
两个二项组与目标参数
设n_1,n_0≥1固定,两组成功数相互独立,满足二项模型
定义优势比与总成功数
优势是成功概率除以失败概率;优势比不是概率之比p_1/p_0。观测到K=k以后,以A=X表示第一组的成功数,其支持为全部整数
按条件概率归一化联合二项质量,得到
推导时,共同因子为
这里的非中心族来自独立二项组的条件化。它不等于任意“不同权重逐次无放回抽取”的结果;后一抽样过程必须另行给出概率规则。
条件MLE:内部根和边界上确界
令η=logθ,条件对数似然忽略常数后为
若L<U,每个支持点在有限θ下概率都严格正,故方差严格正。均值随η严格增加,并在θ↓0和θ↑∞时分别趋L与U。因此:
- L<a<U时,有唯一有限条件MLE,由
确定。 - a=L时,似然在θ↓0时逼近上确界;a=U时,在θ↑∞时逼近上确界。0与∞是扩展边界,均不是参数空间(0,∞)内的有限MLE。
- L=U时,条件分布恒为一个点,似然与θ无关,所有θ>0都同样合适,没有识别信息。
这些结论不需要大样本正态近似,也不由样本交叉乘积比直接替代。
等尾置信集合及其覆盖
固定0<α<1,对观测a定义两条包含观测点的尾概率
保留未被两份α/2尾检验排除的参数,得到置信集合
它是一个区间。对于L<a≤U,下端θ_−是方程
L=U时,式(3)给整个(0,∞)。0和∞是描述区间形状的边界记号,不是假设参数真的可以取这些值。本页在端点观测时仍将每一尾固定为α/2,不临时改用单侧α。
直觉
总成功数k决定了这批资料一共出现多少成功。固定k以后,θ只控制这些成功更倾向于落在哪一组:θ大时,第一组取得较多成功的子表获得更高权重。每个表的组合数w_a记录产生它的标记数量,θ^a则给出相对倾向。
当观察数位于支持内部,可以把条件均值调到该位置;位于最左端时,任意正θ仍会给右边一些概率,只有θ不断减小才能更集中于观测端点。这是边界上确界的机制,不是求根精度不够。
置信区间则询问:哪些θ会使眼前的a落得过于靠左或靠右?左右尾各预留α/2,哪怕离散性使实际失败概率更小,也不将未用尽的概率事后挪到另一侧。
例子与边界
一张表产生三个不同的量
观测表为
| 组别 | 成功 | 失败 | 合计 |
|---|---|---|---|
| 第一组 | 2 | 1 | 3 |
| 第二组 | 1 | 2 | 3 |
此时n_1=n_0=3、k=3、a=2,支持为0、1、2、3,组合权重为1、9、9、1。因此
样本交叉乘积比为4,它也是在两组内部样本比例都位于(0,1)时,将各自无条件MLE代入θ得到的值。条件均值方程却是
即
取α=0.05,尾端点由
确定,数值为
条件MLE、交叉比和尾反演端点不同,是它们定义不同。区间很宽则忠实反映该固定边缘实验只有少量可能结果;把宽区间截短不会保持原来的覆盖证明。
左图对应当前单表;右图对应本文末尾的共同优势比卷积接口,其完整输入见终点。两图都用对数坐标,淡蓝区域表示两条尾约束同时成立,不表示给参数分配了后验概率。
全部成功落在一组时
保留n_1=n_0=3、k=3,但观察a=3。条件MLE只有θ→∞的上确界。等尾区间仍有有限下端,它由
若k=0或k=n_1+n_0,支持只有一个点,每个θ都给相同的条件质量1。此时整个正实轴才是式(3)的答案。不能因为原表中某些格子为零,就无条件套一个“每格加半”的交叉比来代替条件似然与区间。
等尾反演和其他两侧检验
Fisher检验常见的另一种两侧约定,是累加零假设下概率不大于观测表概率的所有表。它与两份单尾α/2规则一般不同。本页式(3)只宣称是所写等尾检验的反演,不宣称恰好反演所有软件中名为“Fisher两侧”的p值。
零假设θ=1时,式(1)与旧Fisher页的中央分布一致;估计未知θ、检验一个指定θ、反演整族检验,是三个需要各自说明输出的任务。
推论与应用
尾单调性与覆盖的完整证明
对任意函数g,在有限支持上逐项微分式(1),得
取A′为A的独立同分布副本,有
g递增时每项非负;若g在支持上并非常数,至少一对支持点给正贡献。因此
固定真θ和k。右尾变量
这是检验反演的覆盖证明。两个尾变量不需要独立。对原模型的K再取平均,对每个p_1,p_0∈(0,1)也得到无条件覆盖至少1−α。离散性通常使覆盖大于名义值,“精确”在这里表示有限样本保证,而非每个参数处都恰好等于1−α。
稳定计算与停止证书
相邻未归一化质量满足
可以先用比值找到质量最大的位置,令该处相对重量为1,向左右递推,再统一归一化;也可在对数尺度计算全部质量并减去最大对数。这样避免直接计算巨大组合数与θ的幂。一次质量、均值或尾求值需要O(U−L+1)次算术及O(U−L+1)存储;只需一个目标尾时还可流式求和。
内部MLE和有限区间端点都可在η=logθ上求解。先检查支持与观测端点,排除应直接输出0、∞或无信息的情况;然后扩展左右η界,直到单调方程在两端异号,再二分。若最初有效括区间长度为B,欲将η端点宽度降到ε,需要至多
多层共同优势比不是简单合并原表
若各层独立,并且都具有同一个θ,固定每层自己的总成功数后,第j层有多项式
系数c_t由有限卷积得到。于是对T可重复本页的均值方程和尾反演;同一θ与层间独立是必要模型输入。直接合并原始两组计数只固定合并总数,没有保留每层边缘,通常产生另一份条件多项式。完整迁移例见二元似然与条件推断终点。
参考资料
- Alan Agresti,A Survey of Exact Inference for Contingency Tables,Statistical Science 7(1),1992,pp.131–153,§1.3与§2.2;固定边缘非中心超几何族、条件MLE与区间。本页明确采用全程α/2的等尾约定,包括端点观测。
- Sean X. Chen and Jun S. Liu,Statistical Applications of the Poisson-Binomial and Conditional Bernoulli Distributions,Statistica Sinica 7,1997,pp.875–892,§2–3;条件有限分布及其归一化计算。