Skip to content

方法Method

等效性检验与双单侧TOST

Equivalence test · Two one-sided tests · TOST · 双单侧等效检验

将预设等效区间外的复合零假设拆成两个单侧检验,证明无需Bonferroni的整体校准、等尾区间包含规则与共享尺度下的真实功效。

“没有发现差异”可能只是测量太不精确。要证明差异足够小,应先说明多大差异仍可接受,再让数据排除区间两侧的不可接受值。TOST把这个目标转成两个都必须通过的单侧检验。

形式陈述 ​

等效声明先固定边界 ​

设模型参数为ϑ,目标实数为θ=θ(ϑ)。在看数据前固定有限边界L<U和水平0<α<1/2。要检验的是

(1)H0:θ≤L 或 θ≥U,H1:L<θ<U.

这里零假设是区间外的整个参数集合,包含两个端点;并非只检验θ=0。为两个分量H0L:θ≤L、H0U:θ≥U分别构造水平至多α的单侧检验。TOST规则要求两者都拒绝,才拒绝式(1)的整体零假设。

若pL,pU各自在自己的复合零假设下有效,则

(2)pTOST=max(pL,pU),拒绝当且仅当 pTOST<α.

本页统一用严格小于作拒绝规则;连续模型的等号事件概率为零,离散模型则保留这项约定。TOST是交并检验在两个区间外分量上的特例,两个检验各用α,无须各改用α/2。

IID正态均值的精确版本 ​

下面的精确版本以正态分布为抽样模型;前面的交并规则本身不要求这一模型。

设X1,…,Xn为IID N(μ,σ2),n≥2、σ>0,目标为θ=μ。记

X¯=1n∑iXi,S2=1n−1∑i(Xi−X¯)2,se=Sn,ν=n−1.

在S>0的事件上,计算

(3)tL=X¯−Lse,tU=X¯−Use,pL=1−Ftν(tL),pU=Ftν(tU).

用中心t分位数c=t1−α,ν>0,两侧通过等价于

(4)L+cse<X¯<U−cse.

也等价于等尾1−2α均值置信区间

(5)[X¯−cse, X¯+cse]⊂(L,U).

右侧是严格位于开区间内部,不能把贴着边界的情况算作通过。式(5)指定了区间怎样分配两侧尾概率,并非任意总覆盖1−2α的区间都有同一个检验水平。

双单侧等效的两道边界

绿色区域同时满足两个严格不等式;增大标准误会缩小允许的均值范围。右图分别展示通过、区间过宽和单侧越界。

直觉

两个失败方向,只需防住真实的那个 ​

若真实θ≤L,整体错误等效声明必然包含错误拒绝左侧零假设,概率至多α。若真实θ≥U,改用右侧即可。这正是交并原理的证明,不要求pL,pU独立。

Bonferroni常处理“只要一项错误拒绝就算出错”的并事件。这里的等效声明要求两个拒绝同时成立,是交事件;错误的集合结构不同。若研究另外允许从多个候选对象中挑任意一个宣布等效,外层又出现新的并事件,需要另行控制。

为什么在边界用中心t足够 ​

令Z=n(X¯−μ)/σ、R=S/σ,则Z为标准正态,νR2∼χν2,且两者独立。于是

tL=Z+n(μ−L)/σR.

在μ=L时它是中心t;在μ<L时,固定同一Z,R后其值逐样本更小,因此右尾拒绝概率不会增大。右侧检验同理。这个耦合也说明式(3)的p值在整个复合零假设下有效,而不只是两个边界点有效。

该随机比值正是带符号的非中心t。非中心参数使用真实σ,不是观察后将S代入而得到的一项随机“效应参数”。

区间反演必须保留两条单侧合同 ​

第一项拒绝要求X¯−cse>L,第二项要求X¯+cse<U,合起来就是式(5)。这使用检验与置信界的反演,并且分别保留了两条1−α单侧界。

α=.05时,通常说“90%区间完全落入等效边界”,这个90%来自两个各5%的尾。它没有把检验水平降为10%,也不允许随便拿一种90%区间替代指定的等尾构造。

例子与边界

五个读数的均值等效 ​

读数为(−.1,−.1,0,.1,.1)。有X¯=0、S=.1、ν=4。预设边界为(−.1,.1),则tL=5、tU=−5。中心t4的对称性给两侧相同p值,精确为

(6)pTOST=27−11554≈.0445047<.05.

这可由t4密度积分,也可在非中心分布页四自由度闭式中令δ=0直接得到。t.95,4≈2.13185,故等尾90%区间半宽约.09534,确实小于.1。均值等效结论不表示每个未来读数都落在这段内;总体含量的要求转到容忍区间,概率命题会改变。

反过来,若某次X¯=0而标准误为.5,检验均值是否为0不会拒绝,TOST却不能通过(−.1,.1):式(4)的允许区间已经为空。未拒绝零差异并没有提供小差异的证据。

不对称90%区间可以破坏5%声明 ​

设已知标准误为1,θ^∼N(θ,1)。令zp=Φ−1(p)。区间

[θ^−z.91, θ^+z.99]

的覆盖率恰为.91−.01=.90,但其左端与右端分别使用9%和1%的检验尾。若等效区间为(0,10),在真实θ=0时,包含拒绝规则的概率为

Φ(10−z.99)−Φ(z.91)=.09−{1−Φ(10−z.99)}>.05.

例如z.99<3,所以最后的上尾小于P(Z>7)<.01,已经足以严格推出拒绝率大于.08。总覆盖90%没有单独保证两侧各至多5%。

离散TOST的实际size可能更小 ​

设X∼Binomial(10,p),目标为p∈(1/5,4/5),水平.05。用二项分布的精确尾概率

pL(x)=P1/5(X≥x),pU(x)=P4/5(X≤x).

将十个Bernoulli变量都写成1{Ui≤p}可见X随p逐样本增大,故边界尾在相应复合零假设下有效。逐个检查x=0,…,10,只有x=5两侧都通过;此时两侧尾都是320249/9765625≈.0327935。

整体错误拒绝率因此是Pp(X=5)=252p5(1−p)5。它在[0,1/2]递增、在[1/2,1]递减,故在区间外的最大值于p=1/5或4/5取得,等于

(7)2580489765625≈.0264241<.05.

水平至多5%仍然成立,但不能把它写成实际size必等于5%。离散性之外,同时满足两个拒绝也可能增加保守性。

目标、模型与预先选择 ​

配对数据先取每对差Di,若这些差为IID正态,就对差的均值用式(3);不要求同一对的两个原读数独立。两独立正态组若有共同方差且n1,n2≥2,则用均值差、合并方差标准误Sp1/n1+1/n2与ν=n1+n2−2。异方差时直接采用Welch自由度一般是近似版本,不能无条件保留本页精确t校准。

若对正比值Ri先取Di=log⁡Ri,所检验的是Elog⁡R及其指数,即几何均值尺度。比如log⁡R∼N(0,1)时,exp⁡(Elog⁡R)=1,却有ER=e1/2。几何均值比等效不会自动证明算术均值比等效。

边界必须由任务要求预先给出。看完区间后再把L,U移到能包含它的位置,改变了被校准的随机规则。S=0在所设非退化连续正态模型下概率为零;实际读数若因舍入全部相同,应报告尺度计算退化并检查观测模型,不能用除零计算制造等效结论。

推论与应用

规划功效是同时通过的概率 ​

先考虑已知σ,令se=σ/n、c=z1−α。若L+cse≥U−cse,接受等效的区域为空,功效为零;否则在真实均值μ下,功效为

(8)Φ(U−μse−c)−Φ(L−μse+c).

对L=−Δ,U=Δ,μ=0,它化为

[2Φ(Δnσ−z1−α)−1]+.

因此要达到1−β,其中0<β<1,所需最小整数样本量为

(9)nmin=⌈σ2Δ2{z1−α+z1−β/2}2⌉.

例如σ=1,Δ=.5,α=.05、目标功效.8时,n=34的功效约.796137,n=35约.810880,首次达标是35。n=25仅约.607530;单侧检验中另一项样本量计算不能直接移来。

未知尺度时,令a=n(L−μ)/σ、b=n(U−μ)/σ、R=V/ν、V∼χν2、c=t1−α,ν。条件于R后,共享的Z必须落在(a+cR,b−cR),所以功效为

(10)E{[Φ(b−cR)−Φ(a+cR)]+}.

两个单侧统计量共享同一均值和同一样本方差,整体功效一般不等于两个非中心t边缘功效的乘积。式(10)可以按非中心分布页的正密度积分包围方式复算,但须同时控制该新被积函数及尾部误差。

计算与报告 ​

单样本实现先检查n≥2、边界顺序和尺度非退化,再用O(n)次算术统计均值与离差平方和,额外存储可为常数;随后调用两次中心t的CDF,或比较式(4)的两个不等式。CDF或分位数的评估成本和精度独立于这项样本汇总成本。接近阈值时,应保留数值包含误差,不能让显示到三位的小数决定拒绝。

报告至少包含目标参数、预设边界、模型、两个单侧p值和整体结论。若任务只要求排除一侧不可接受差异,就是非劣性等单侧问题,复用单侧水平与功效即可;它并未同时排除另一侧,不应改名成双侧等效。

参考资料
关系图谱14 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系