“没有发现差异”可能只是测量太不精确。要证明差异足够小,应先说明多大差异仍可接受,再让数据排除区间两侧的不可接受值。TOST把这个目标转成两个都必须通过的单侧检验。
形式陈述
等效声明先固定边界
设模型参数为ϑ ,目标实数为θ = θ ( ϑ ) 。在看数据前固定有限边界L < U 和水平0 < α < 1 / 2 。要检验的是
或 (1) H 0 : θ ≤ L 或 θ ≥ U , H 1 : L < θ < U . 这里零假设 理路 统计假设检验 Statistical hypothesis test · Test function 在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。 是区间外的整个参数集合,包含两个端点;并非只检验θ = 0 。为两个分量H 0 L : θ ≤ L 、H 0 U : θ ≥ U 分别构造水平至多α 的单侧检验。TOST规则 要求两者都拒绝,才拒绝式(1)的整体零假设。
若p L , p U 各自在自己的复合零假设下有效,则
拒 绝 当 且 仅 当 (2) p TOST = max ( p L , p U ) , 拒绝当且仅当 p TOST < α . 本页统一用严格小于作拒绝规则;连续模型的等号事件概率为零,离散模型则保留这项约定。TOST是交并检验 理路 交并检验原理 Intersection–union test · Intersection union test · IUT · 交集拒绝与并集原假设 当总体原假设是若干分量原假设的并集时,只有全部分量检验拒绝才作总体声明,同一水平无需再除以分量数。 在两个区间外分量上的特例,两个检验各用α ,无须各改用α / 2 。
IID正态均值的精确版本
下面的精确版本以正态分布 理路 正态分布 Normal distribution · Gaussian distribution · 高斯分布 具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。 为抽样模型;前面的交并规则本身不要求这一模型。
设X 1 , … , X n 为IID N ( μ , σ 2 ) ,n ≥ 2 、σ > 0 ,目标为θ = μ 。记
X ¯ = 1 n ∑ i X i , S 2 = 1 n − 1 ∑ i ( X i − X ¯ ) 2 , s e = S n , ν = n − 1. 在S > 0 的事件上,计算
(3) t L = X ¯ − L s e , t U = X ¯ − U s e , p L = 1 − F t ν ( t L ) , p U = F t ν ( t U ) . 用中心t分位数 理路 Student t 分布 Student's t-distribution · t distribution 由独立正态分子与卡方随机尺度定义 t 分布,解释自由度、重尾机制及正态样本均值的精确推断。 c = t 1 − α , ν > 0 ,两侧通过等价于
(4) L + c s e < X ¯ < U − c s e . 也等价于等尾1 − 2 α 均值置信区间
(5) [ X ¯ − c s e , X ¯ + c s e ] ⊂ ( L , U ) . 右侧是严格位于开区间内部,不能把贴着边界的情况算作通过。式(5)指定了区间怎样分配两侧尾概率,并非任意总覆盖1 − 2 α 的区间都有同一个检验水平。
图片加载失败 双单侧等效的两道边界 绿色区域同时满足两个严格不等式;增大标准误会缩小允许的均值范围。右图分别展示通过、区间过宽和单侧越界。
直觉
两个失败方向,只需防住真实的那个
若真实θ ≤ L ,整体错误等效声明必然包含错误拒绝左侧零假设,概率至多α 。若真实θ ≥ U ,改用右侧即可。这正是交并原理的证明,不要求p L , p U 独立。
Bonferroni常处理“只要一项错误拒绝就算出错”的并事件。这里的等效声明要求两个拒绝同时成立,是交事件;错误的集合结构不同。若研究另外允许从多个候选对象中挑任意一个宣布等效,外层又出现新的并事件,需要另行控制。
为什么在边界用中心t足够
令Z = n ( X ¯ − μ ) / σ 、R = S / σ ,则Z 为标准正态,ν R 2 ∼ χ ν 2 ,且两者独立。于是
t L = Z + n ( μ − L ) / σ R . 在μ = L 时它是中心t;在μ < L 时,固定同一Z , R 后其值逐样本更小,因此右尾拒绝概率不会增大。右侧检验同理。这个耦合也说明式(3)的p值在整个复合零假设下有效,而不只是两个边界点有效。
该随机比值正是带符号的非中心t 理路 非中心χ²、t与F分布 Noncentral distributions · Noncentral chi-square distribution · Noncentral t distribution · Noncentral F distribution · 非中心卡方分布 · 非中心t分布 · 非中心F分布 先移动正态均值再平方或除以独立随机尺度,统一得到非中心χ²、t和F,并用Poisson混合与条件积分计算备择下的功效。 。非中心参数使用真实σ ,不是观察后将S 代入而得到的一项随机“效应参数”。
区间反演必须保留两条单侧合同
第一项拒绝要求X ¯ − c s e > L ,第二项要求X ¯ + c s e < U ,合起来就是式(5)。这使用检验与置信界的反演 理路 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 ,并且分别保留了两条1 − α 单侧界。
α = .05 时,通常说“90%区间完全落入等效边界”,这个90%来自两个各5%的尾。它没有把检验水平降为10%,也不允许随便拿一种90%区间替代指定的等尾构造。
例子与边界
五个读数的均值等效
读数为( − .1 , − .1 , 0 , .1 , .1 ) 。有X ¯ = 0 、S = .1 、ν = 4 。预设边界为( − .1 , .1 ) ,则t L = 5 、t U = − 5 。中心t 4 的对称性给两侧相同p值,精确为
(6) p TOST = 27 − 11 5 54 ≈ .0445047 < .05 . 这可由t 4 密度积分,也可在非中心分布页四自由度闭式中令δ = 0 直接得到。t .95 , 4 ≈ 2.13185 ,故等尾90%区间半宽约.09534 ,确实小于.1 。均值等效结论不表示每个未来读数都落在这段内;总体含量的要求转到容忍区间 理路 正态容忍区间与总体含量认证 Normal tolerance interval · Normal tolerance limit · 正态容忍限 · 正态容限区间 分清对样本的置信与对总体的含量,用非中心t构造精确单侧正态容忍限,并证明双侧保守因子和对称精确因子的积分刻画。 ,概率命题会改变。
反过来,若某次X ¯ = 0 而标准误为.5 ,检验均值是否为0不会拒绝,TOST却不能通过( − .1 , .1 ) :式(4)的允许区间已经为空。未拒绝零差异并没有提供小差异的证据。
不对称90%区间可以破坏5%声明
设已知标准误为1,θ ^ ∼ N ( θ , 1 ) 。令z p = Φ − 1 ( p ) 。区间
[ θ ^ − z .91 , θ ^ + z .99 ] 的覆盖率恰为.91 − .01 = .90 ,但其左端与右端分别使用9%和1%的检验尾。若等效区间为( 0 , 10 ) ,在真实θ = 0 时,包含拒绝规则的概率为
Φ ( 10 − z .99 ) − Φ ( z .91 ) = .09 − { 1 − Φ ( 10 − z .99 ) } > .05 . 例如z .99 < 3 ,所以最后的上尾小于P ( Z > 7 ) < .01 ,已经足以严格推出拒绝率大于.08 。总覆盖90%没有单独保证两侧各至多5%。
离散TOST的实际size可能更小
设X ∼ Binomial ( 10 , p ) ,目标为p ∈ ( 1 / 5 , 4 / 5 ) ,水平.05 。用二项分布 理路 二项分布 Binomial distribution 固定次数独立同概率 Bernoulli 试验中成功总数的离散分布。 的精确尾概率
p L ( x ) = P 1 / 5 ( X ≥ x ) , p U ( x ) = P 4 / 5 ( X ≤ x ) . 将十个Bernoulli变量都写成1 { U i ≤ p } 可见X 随p 逐样本增大,故边界尾在相应复合零假设下有效。逐个检查x = 0 , … , 10 ,只有x = 5 两侧都通过;此时两侧尾都是320249 / 9765625 ≈ .0327935 。
整体错误拒绝率因此是P p ( X = 5 ) = 252 p 5 ( 1 − p ) 5 。它在[ 0 , 1 / 2 ] 递增、在[ 1 / 2 , 1 ] 递减,故在区间外的最大值于p = 1 / 5 或4 / 5 取得,等于
(7) 258048 9765625 ≈ .0264241 < .05 . 水平至多5%仍然成立,但不能把它写成实际size必等于5%。离散性之外,同时满足两个拒绝也可能增加保守性。
目标、模型与预先选择
配对数据先取每对差D i ,若这些差为IID正态,就对差的均值用式(3);不要求同一对的两个原读数独立。两独立正态组若有共同方差且n 1 , n 2 ≥ 2 ,则用均值差、合并方差标准误S p 1 / n 1 + 1 / n 2 与ν = n 1 + n 2 − 2 。异方差时直接采用Welch自由度一般是近似版本,不能无条件保留本页精确t校准。
若对正比值R i 先取D i = log R i ,所检验的是E log R 及其指数,即几何均值尺度。比如log R ∼ N ( 0 , 1 ) 时,exp ( E log R ) = 1 ,却有E R = e 1 / 2 。几何均值比等效不会自动证明算术均值比等效。
边界必须由任务要求预先给出。看完区间后再把L , U 移到能包含它的位置,改变了被校准的随机规则。S = 0 在所设非退化连续正态模型下概率为零;实际读数若因舍入全部相同,应报告尺度计算退化并检查观测模型,不能用除零计算制造等效结论。
推论与应用
规划功效是同时通过的概率
先考虑已知σ ,令s e = σ / n 、c = z 1 − α 。若L + c s e ≥ U − c s e ,接受等效的区域为空,功效为零;否则在真实均值μ 下,功效为
(8) Φ ( U − μ s e − c ) − Φ ( L − μ s e + c ) . 对L = − Δ , U = Δ , μ = 0 ,它化为
[ 2 Φ ( Δ n σ − z 1 − α ) − 1 ] + . 因此要达到1 − β ,其中0 < β < 1 ,所需最小整数样本量为
(9) n min = ⌈ σ 2 Δ 2 { z 1 − α + z 1 − β / 2 } 2 ⌉ . 例如σ = 1 , Δ = .5 , α = .05 、目标功效.8 时,n = 34 的功效约.796137 ,n = 35 约.810880 ,首次达标是35。n = 25 仅约.607530 ;单侧检验中另一项样本量计算不能直接移来。
未知尺度时,令a = n ( L − μ ) / σ 、b = n ( U − μ ) / σ 、R = V / ν 、V ∼ χ ν 2 、c = t 1 − α , ν 。条件于R 后,共享的Z 必须落在( a + c R , b − c R ) ,所以功效为
(10) E { [ Φ ( b − c R ) − Φ ( a + c R ) ] + } . 两个单侧统计量共享同一均值和同一样本方差,整体功效一般不等于两个非中心t边缘功效的乘积。式(10)可以按非中心分布页的正密度积分包围方式复算,但须同时控制该新被积函数及尾部误差。
计算与报告
单样本实现先检查n ≥ 2 、边界顺序和尺度非退化,再用O ( n ) 次算术统计均值与离差平方和,额外存储可为常数;随后调用两次中心t的CDF,或比较式(4)的两个不等式。CDF或分位数的评估成本和精度独立于这项样本汇总成本。接近阈值时,应保留数值包含误差,不能让显示到三位的小数决定拒绝。
报告至少包含目标参数、预设边界、模型、两个单侧p值和整体结论。若任务只要求排除一侧不可接受差异,就是非劣性等单侧问题,复用单侧水平与功效 理路 第一/第二类错误与检验功效 Type I and type II errors · Power function 检验在零假设下错误拒绝、在备择下未拒绝的概率及其参数化拒绝能力。 即可;它并未同时排除另一侧,不应改名成双侧等效。
参考资料