中心分布常用来决定零假设下的阈值。真实均值偏离零假设时,统计量的计算规则没有改变,但它的抽样分布会改变。非中心分布把这项偏离保留在参数里:平方之前的位移会增加长度,除以随机标准差之前的位移则还保留正负方向。
形式陈述
三种共享正态构件的定义
设Z 1 , … , Z k 独立标准正态,a ∈ R k 固定,k ≥ 1 。定义
(1) Q = ∑ i = 1 k ( Z i + a i ) 2 , λ = ∑ i = 1 k a i 2 . Q 服从非中心卡方分布,记作χ k 2 ( λ ) 。λ ≥ 0 是非中心参数。λ = 0 回到中心卡方 理路 卡方分布 Chi-square distribution · Chi-squared distribution · χ² distribution 若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。 ;λ 不是卡方变量自身的均值。
令Z ∼ N ( 0 , 1 ) 、V ∼ χ ν 2 独立,ν > 0 、δ ∈ R 。定义非中心t分布
(2) T = Z + δ V / ν ∼ t ν ( δ ) . 再令Q ∼ χ d 1 2 ( λ ) 与V ∼ χ d 2 2 独立,d 1 , d 2 > 0 ,定义非中心F分布
(3) F = Q / d 1 V / d 2 ∼ F d 1 , d 2 ( λ ) . 本页的F只有分子非中心,分母仍是独立中心卡方。非整数正自由度的Q 由下面的混合定义;只有正整数自由度才逐字对应式(1)的有限平方和。
χ²与F共享的Poisson混合
令r = λ / 2 ,K ∼ Poisson ( r ) 。先抽K ,再独立生成条件律
(4) Q ∣ K = j ∼ χ k + 2 j 2 . 式(4)与式(1)同分布,并将k 推广到任意k > 0 。若F χ s 2 ( x ) 表示中心卡方CDF,则
(5) F χ k 2 ( λ ) ( x ) = ∑ j = 0 ∞ w j F χ k + 2 j 2 ( x ) , w j = e − r r j j ! . 密度也用相同权重混合。对非中心F,条件于K = j 后
(6) F ∣ K = j = d d 1 + 2 j d 1 F d 1 + 2 j , d 2 , 所以其CDF为
(7) F d 1 , d 2 , λ ( x ) = ∑ j = 0 ∞ w j F F d 1 + 2 j , d 2 ( d 1 x d 1 + 2 j ) . 式(6)中的缩放不能丢掉:原统计量一直除以d 1 ,没有随随机K 改除以d 1 + 2 K 。
t的符号与条件积分
用Φ , ϕ 表示标准正态CDF与密度,f χ ν 2 表示中心卡方密度。对分母条件化,
(8) F ν , δ ( t ) = ∫ 0 ∞ Φ ( t v / ν − δ ) f χ ν 2 ( v ) d v . 因此F ν , δ ( 0 ) = Φ ( − δ ) ,且
(9) − T ∼ t ν ( − δ ) , T 2 ∼ F 1 , ν ( δ 2 ) . 平方后只剩δ 2 ,无法区分两个方向。不能把式(5)的Poisson混合直接照搬成中心t的正权重混合:任何这类混合仍关于零对称,而非零δ 的非中心t一般不对称。
直觉
位移进入平方,产生混合层数
对一个标准正态Z 和固定a ,在t < 1 / 2 时配方积分得
E e t ( Z + a ) 2 = ( 1 − 2 t ) − 1 / 2 exp ( a 2 t 1 − 2 t ) . 独立相乘得到矩母函数 理路 矩母函数 Moment-generating function · MGF 在存在邻域内以 E[e^{tX}] 编码随机变量各阶矩的函数。
(10) M Q ( t ) = ( 1 − 2 t ) − k / 2 exp ( λ t 1 − 2 t ) . 将指数部分写成e − r exp { r / ( 1 − 2 t ) } 并展开,
M Q ( t ) = ∑ j = 0 ∞ e − r r j j ! ( 1 − 2 t ) − ( k + 2 j ) / 2 . 右侧正是Poisson权重 理路 Poisson 分布 Poisson distribution · 泊松分布 以强度参数描述固定窗口内稀有事件计数的离散分布。 混合中心卡方的矩母函数。它们在零附近存在,由矩母函数唯一性得到式(4)。这里K 是分布表示中的辅助变量,不是原观测里已经看见的一个样本数。
对式(10)求导,或对式(4)使用全期望与全方差,得到
(11) E Q = k + λ , Var ( Q ) = 2 k + 4 λ . 这也说明χ k 2 ( λ ) 不等于“中心卡方加常数λ ”:后者方差仍为2 k 。
随机分母改变的不只是中心位置
式(8)实际使用条件期望 理路 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 :给定V = v ,式(2)不超过t 恰好等价于Z ≤ t v / ν − δ 。再对v 的密度积分即可。相同条件化还给密度
f ν , δ ( t ) = ∫ 0 ∞ v / ν ϕ ( t v / ν − δ ) f χ ν 2 ( v ) d v > 0. 所以CDF连续严格递增,有唯一的内部概率分位数。固定同一Z , V ,增加δ 会逐样本增大T ;固定t 时,CDF随δ 递减。
非中心t一般也不是t ν + δ 。例如ν = 1 , δ = 1 ,非中心变量不超过0的概率为Φ ( − 1 ) ≈ 0.1587 ,而中心Cauchy平移1后不超过0的概率是1 / 4 。位移发生在除尺度之前与之后,得到两种不同分布。
式(9)来自( Z + δ ) 2 ∼ χ 1 2 ( δ 2 ) ,分母仍独立;式(6)则实际使用中心F的独立卡方比 理路 F 分布 F-distribution · Fisher–Snedecor distribution 两个独立卡方变量分别除以自由度后所得比值的正值分布。 ,把条件分子按新的自由度标准化后,再补回原有比例。
例子与边界
正态均值检验的备择分布
若X i 为IID N ( μ , σ 2 ) 、n ≥ 2 、σ > 0 ,正态样本均值与样本方差的独立分解给
(12) n ( X ¯ − μ 0 ) S ∼ t n − 1 ( n ( μ − μ 0 ) σ ) . 例如单侧检验使用中心t分位数 理路 Student t 分布 Student's t-distribution · t distribution 由独立正态分子与卡方随机尺度定义 t 分布,解释自由度、重尾机制及正态样本均值的精确推断。 c = t 1 − α , n − 1 定阈值;在真实效应μ − μ 0 下,功效为1 − F n − 1 , δ ( c ) 。阈值来自零假设,功效来自备择分布,两者不能都用同一个中心CDF。
正态模型中的δ 使用真实σ 。将本次观测的S 代回去得到的“事后功效”是另一项数据函数,不会自动变成预先设计的真实拒绝概率。
只计算被检验方向上的位移
设Y ∼ N 7 ( m , I ) ,其中
m = ( 1 , 1 , 10 , 0 , 0 , 0 , 0 ) . 只检验前两个方向,以
Q = Y 1 2 + Y 2 2 , V = Y 4 2 + Y 5 2 + Y 6 2 + Y 7 2 组成F = ( Q / 2 ) / ( V / 4 ) 。由联合正态正交坐标的独立性 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ,Q ∼ χ 2 2 ( 2 ) 与V ∼ χ 4 2 独立,所以F ∼ F 2 , 4 ( 2 ) 。第三个方向的均值10没有进入检验或分母,不能把总平方长度102当成非中心参数。
一般正交投影P 的非中心参数是‖ P m ‖ 2 。用于分母的正交残差投影还必须消掉真实均值;若残差均值也不为零,分母不再中心,本页式(3)不适用。
对这个例子,令b = x / ( x + 2 ) 。中心F的Beta变换使式(7)的第j 项CDF等于
I b ( j + 1 , 2 ) = b j + 1 { j + 2 − ( j + 1 ) b } . 它可以直接由密度( j + 1 ) ( j + 2 ) u j ( 1 − u ) 在[ 0 , b ] 积分得到。用r = 1 的Poisson权重求和,得到
P ( F ≤ x ) = b ( 2 − b 2 ) e b − 1 . x = 3 时b = 3 / 5 ,所以
(13) P ( F > 3 ) = 1 − 123 125 e − 2 / 5 ≈ 0.340405 . 同一阈值在中心F 2 , 4 下的上尾为( 1 − b ) 2 = 4 / 25 。这个特意选择的阈值方便精确复算;它对应水平0.16 ,不是未经计算的“通常5%阈值”。
参数与支撑边界
若正态协方差不是单位矩阵,应先按所检验的几何白化。相关正态原坐标的平方和一般是加权二次型,不能仅凭均值非零套式(1)。
λ 不能为负,δ 却允许两种符号。k , d 1 , d 2 , ν 在本页都严格为正;将k = 0 放进Poisson延拓时,K = 0 会产生位于零的原子,质量为e − λ / 2 ,不能继续把全部分布写成连续密度。整数维构造中零维向量更不能有非零位移。
取非中心F的倒数会把非中心构件移到分母,一般不是把d 1 , d 2 交换后仍保留同一个单非中心F标签。只有中心情形才有旧页中的简单倒数公式。
推论与应用
共享混合的有限误差预算
对式(5)或式(7),只累加j = 0 , … , M 的项,记结果为S M ,则
(14) S M ≤ F ( x ) ≤ S M + Pr ( K > M ) . 因为每项中心CDF都在[ 0 , 1 ] ,遗漏的总贡献不会超过遗漏的Poisson质量。相同结论直接适用于上尾分量,避免先算接近1的CDF再相减造成消减误差。
权重递推为w 0 = e − r 、w j + 1 = w j r / ( j + 1 ) 。若M + 2 > r ,还可用
(15) Pr ( K > M ) ≤ w M + 1 1 − r / ( M + 2 ) . 证明是从首个遗漏项起,其后相邻比值都不超过r / ( M + 2 ) < 1 。算法递推到该尾界和各中心CDF评估误差共同小于预算,再输出包含区间。需M + 1 次中心CDF调用和O ( M + 1 ) 算术操作;逐项累加只需常数个工作变量。有理数位成本、极大r 的下溢和中心CDF本身的成本另计,不能把一项库函数调用当成无误差常数。
非中心t也有可终止的积分包围
式(8)中的g ( v ) = Φ ( t v / ν − δ ) 随v 单调,方向由t 决定。在0 = v 0 < ⋯ < v M = B 上,每一段的贡献被
min { g ( v j − 1 ) , g ( v j ) } P ( v j − 1 < V ≤ v j ) 和相应最大值夹住;V > B 的未知贡献放在[ 0 , P ( V > B ) ] 。中心卡方连续,不存在端点原子。使用带误差的CDF与正态CDF时,将它们的包含误差也传播进去。
这个办法不只是停机希望。由E V = ν 及Markov不等式 理路 Markov 不等式 Markov's inequality 非负随机变量超过阈值的概率由其期望除以阈值控制。 ,尾质量至多ν / B ;若网格宽度至多h ,则v 的变化至多h ,而Φ 的导数至多1 / 2 π 。主区间上下和之差因而至多| t | h / ( 2 π ν ) 。先增大B 、再减小h ,便可达到任意预设正误差;t = 0 直接返回Φ ( − δ ) 。这是保守的存在性与计算接口,不是高效数值实现的最优复杂度声明。
若内部概率p ∈ ( 0 , 1 ) 的分位数要达到精度ε > 0 ,先向左右扩展搜索,并收紧CDF误差,直到认证F ( a ) < p < F ( b ) ;两端极限为0、1保证能找到这样的有限括界。单纯只检查中点存在一个停机陷阱:若中点恰为真实分位数,再小的包含误差也可能跨过p 。
可以同时检查x 1 = a + ( b − a ) / 3 、x 2 = a + 2 ( b − a ) / 3 ,逐轮将两处CDF误差减半。严格递增使它们不能同时满足F ( x i ) = p ,所以至少一处最终能认证F ( x i ) < p 或F ( x i ) > p 。前者更新左端为x i ,后者更新右端为x i ;每次都保留真实分位数,而且宽度至多乘2 / 3 。初宽为W 时,至多max { 0 , ⌈ log ( W / ε ) / log ( 3 / 2 ) ⌉ } 次已认证更新便达到目标。每次更新可能需要不同次数和精度的CDF评估,这部分成本另计;没有可靠包含时应保留未认证括界。
四自由度的可复算闭式
ν = 4 时可避免数值积分。对任意实t , δ ,令
A = 4 + t 2 , b = t δ A , q = t δ A , K = e − 2 δ 2 / A A . 则
(16) F 4 , δ ( t ) = Φ ( − δ ) + t K [ ( 1 + 2 b 2 + 2 A ) Φ ( q ) + 2 b A ϕ ( q ) ] . 证明从R = V / 4 开始。其上尾为P ( R > r ) = ( 1 + 2 r 2 ) e − 2 r 2 。在式(8)中分部积分,CDF成为Φ ( − δ ) + t ( J 0 + 2 J 2 ) ,其中
J j = ∫ 0 ∞ r j e − 2 r 2 ϕ ( t r − δ ) d r . 配方并令z = A ( r − b ) ,有J 0 = K Φ ( q ) 。再利用
∫ − q ∞ z ϕ ( z ) d z = ϕ ( q ) , ∫ − q ∞ z 2 ϕ ( z ) d z = Φ ( q ) − q ϕ ( q ) , 得到J 2 = K { ( b 2 + 1 / A ) Φ ( q ) + ( b / A ) ϕ ( q ) } ,即式(16)。这些积分恒等式由ϕ ′ ( z ) = − z ϕ ( z ) 直接分部积分得到。
正态容忍上界 理路 正态容忍区间与总体含量认证 Normal tolerance interval · Normal tolerance limit · 正态容忍限 · 正态容限区间 分清对样本的置信与对总体的含量,用非中心t构造精确单侧正态容忍限,并证明双侧保守因子和对称精确因子的积分刻画。 把总体含量要求变成非中心t分位数;五样本时正好使用式(16)。等效性检验 理路 等效性检验与双单侧TOST Equivalence test · Two one-sided tests · TOST · 双单侧等效检验 将预设等效区间外的复合零假设拆成两个单侧检验,证明无需Bonferroni的整体校准、等尾区间包含规则与共享尺度下的真实功效。 的两个单侧功效也可用本页接口计算,但它们共享均值与样本尺度,整体同时通过的概率一般不能用两份边缘功效相乘。
参考资料
R Core Team,官方stats参考:非中心卡方 、非中心t 、F分布 ,定义、参数与计算来源部分。本文另给矩母函数证明、遗漏质量包围与四自由度闭式。
Norman L. Johnson、Samuel Kotz、N. Balakrishnan,Continuous Univariate Distributions ,Vol.2,第2版,1995,Chs.29–31,非中心χ²、F和t。数值近似算法有各自精度范围,正文的概率定义不依赖软件输出多少小数位。