Skip to content

定义Definition

非中心χ²、t与F分布

Noncentral distributions · Noncentral chi-square distribution · Noncentral t distribution · Noncentral F distribution · 非中心卡方分布 · 非中心t分布 · 非中心F分布

先移动正态均值再平方或除以独立随机尺度,统一得到非中心χ²、t和F,并用Poisson混合与条件积分计算备择下的功效。

中心分布常用来决定零假设下的阈值。真实均值偏离零假设时,统计量的计算规则没有改变,但它的抽样分布会改变。非中心分布把这项偏离保留在参数里:平方之前的位移会增加长度,除以随机标准差之前的位移则还保留正负方向。

形式陈述 ​

三种共享正态构件的定义 ​

设Z1,…,Zk独立标准正态,a∈Rk固定,k≥1。定义

(1)Q=∑i=1k(Zi+ai)2,λ=∑i=1kai2.

Q服从非中心卡方分布,记作χk2(λ)。λ≥0是非中心参数。λ=0回到中心卡方;λ不是卡方变量自身的均值。

令Z∼N(0,1)、V∼χν2独立,ν>0、δ∈R。定义非中心t分布

(2)T=Z+δV/ν∼tν(δ).

再令Q∼χd12(λ)与V∼χd22独立,d1,d2>0,定义非中心F分布

(3)F=Q/d1V/d2∼Fd1,d2(λ).

本页的F只有分子非中心,分母仍是独立中心卡方。非整数正自由度的Q由下面的混合定义;只有正整数自由度才逐字对应式(1)的有限平方和。

χ²与F共享的Poisson混合 ​

令r=λ/2,K∼Poisson(r)。先抽K,再独立生成条件律

(4)Q∣K=j∼χk+2j2.

式(4)与式(1)同分布,并将k推广到任意k>0。若Fχs2(x)表示中心卡方CDF,则

(5)Fχk2(λ)(x)=∑j=0∞wjFχk+2j2(x),wj=e−rrjj!.

密度也用相同权重混合。对非中心F,条件于K=j后

(6)F∣K=j =dd1+2jd1Fd1+2j,d2,

所以其CDF为

(7)Fd1,d2,λ(x)=∑j=0∞wjFFd1+2j,d2(d1xd1+2j).

式(6)中的缩放不能丢掉:原统计量一直除以d1,没有随随机K改除以d1+2K。

t的符号与条件积分 ​

用Φ,ϕ表示标准正态CDF与密度,fχν2表示中心卡方密度。对分母条件化,

(8)Fν,δ(t)=∫0∞Φ(tv/ν−δ)fχν2(v)dv.

因此Fν,δ(0)=Φ(−δ),且

(9)−T∼tν(−δ),T2∼F1,ν(δ2).

平方后只剩δ2,无法区分两个方向。不能把式(5)的Poisson混合直接照搬成中心t的正权重混合:任何这类混合仍关于零对称,而非零δ的非中心t一般不对称。

直觉

位移进入平方,产生混合层数 ​

对一个标准正态Z和固定a,在t<1/2时配方积分得

Eet(Z+a)2=(1−2t)−1/2exp(a2t1−2t).

独立相乘得到矩母函数

(10)MQ(t)=(1−2t)−k/2exp(λt1−2t).

将指数部分写成e−rexp⁡{r/(1−2t)}并展开,

MQ(t)=∑j=0∞e−rrjj!(1−2t)−(k+2j)/2.

右侧正是Poisson权重混合中心卡方的矩母函数。它们在零附近存在,由矩母函数唯一性得到式(4)。这里K是分布表示中的辅助变量,不是原观测里已经看见的一个样本数。

对式(10)求导,或对式(4)使用全期望与全方差,得到

(11)EQ=k+λ,Var(Q)=2k+4λ.

这也说明χk2(λ)不等于“中心卡方加常数λ”:后者方差仍为2k。

随机分母改变的不只是中心位置 ​

式(8)实际使用条件期望:给定V=v,式(2)不超过t恰好等价于Z≤tv/ν−δ。再对v的密度积分即可。相同条件化还给密度

fν,δ(t)=∫0∞v/νϕ(tv/ν−δ)fχν2(v)dv>0.

所以CDF连续严格递增,有唯一的内部概率分位数。固定同一Z,V,增加δ会逐样本增大T;固定t时,CDF随δ递减。

非中心t一般也不是tν+δ。例如ν=1,δ=1,非中心变量不超过0的概率为Φ(−1)≈0.1587,而中心Cauchy平移1后不超过0的概率是1/4。位移发生在除尺度之前与之后,得到两种不同分布。

式(9)来自(Z+δ)2∼χ12(δ2),分母仍独立;式(6)则实际使用中心F的独立卡方比,把条件分子按新的自由度标准化后,再补回原有比例。

例子与边界

正态均值检验的备择分布 ​

若Xi为IID N(μ,σ2)、n≥2、σ>0,正态样本均值与样本方差的独立分解给

(12)n(X¯−μ0)S∼tn−1(n(μ−μ0)σ).

例如单侧检验使用中心t分位数c=t1−α,n−1定阈值;在真实效应μ−μ0下,功效为1−Fn−1,δ(c)。阈值来自零假设,功效来自备择分布,两者不能都用同一个中心CDF。

正态模型中的δ使用真实σ。将本次观测的S代回去得到的“事后功效”是另一项数据函数,不会自动变成预先设计的真实拒绝概率。

只计算被检验方向上的位移 ​

设Y∼N7(m,I),其中

m=(1,1,10,0,0,0,0).

只检验前两个方向,以

Q=Y12+Y22,V=Y42+Y52+Y62+Y72

组成F=(Q/2)/(V/4)。由联合正态正交坐标的独立性,Q∼χ22(2)与V∼χ42独立,所以F∼F2,4(2)。第三个方向的均值10没有进入检验或分母,不能把总平方长度102当成非中心参数。

一般正交投影P的非中心参数是‖Pm‖2。用于分母的正交残差投影还必须消掉真实均值;若残差均值也不为零,分母不再中心,本页式(3)不适用。

对这个例子,令b=x/(x+2)。中心F的Beta变换使式(7)的第j项CDF等于

Ib(j+1,2)=bj+1{j+2−(j+1)b}.

它可以直接由密度(j+1)(j+2)uj(1−u)在[0,b]积分得到。用r=1的Poisson权重求和,得到

P(F≤x)=b(2−b2)eb−1.

x=3时b=3/5,所以

(13)P(F>3)=1−123125e−2/5≈0.340405.

同一阈值在中心F2,4下的上尾为(1−b)2=4/25。这个特意选择的阈值方便精确复算;它对应水平0.16,不是未经计算的“通常5%阈值”。

参数与支撑边界 ​

若正态协方差不是单位矩阵,应先按所检验的几何白化。相关正态原坐标的平方和一般是加权二次型,不能仅凭均值非零套式(1)。

λ不能为负,δ却允许两种符号。k,d1,d2,ν在本页都严格为正;将k=0放进Poisson延拓时,K=0会产生位于零的原子,质量为e−λ/2,不能继续把全部分布写成连续密度。整数维构造中零维向量更不能有非零位移。

取非中心F的倒数会把非中心构件移到分母,一般不是把d1,d2交换后仍保留同一个单非中心F标签。只有中心情形才有旧页中的简单倒数公式。

推论与应用

共享混合的有限误差预算 ​

对式(5)或式(7),只累加j=0,…,M的项,记结果为SM,则

(14)SM≤F(x)≤SM+Pr(K>M).

因为每项中心CDF都在[0,1],遗漏的总贡献不会超过遗漏的Poisson质量。相同结论直接适用于上尾分量,避免先算接近1的CDF再相减造成消减误差。

权重递推为w0=e−r、wj+1=wjr/(j+1)。若M+2>r,还可用

(15)Pr(K>M)≤wM+11−r/(M+2).

证明是从首个遗漏项起,其后相邻比值都不超过r/(M+2)<1。算法递推到该尾界和各中心CDF评估误差共同小于预算,再输出包含区间。需M+1次中心CDF调用和O(M+1)算术操作;逐项累加只需常数个工作变量。有理数位成本、极大r的下溢和中心CDF本身的成本另计,不能把一项库函数调用当成无误差常数。

非中心t也有可终止的积分包围 ​

式(8)中的g(v)=Φ(tv/ν−δ)随v单调,方向由t决定。在0=v0<⋯<vM=B上,每一段的贡献被

min{g(vj−1),g(vj)}P(vj−1<V≤vj)

和相应最大值夹住;V>B的未知贡献放在[0,P(V>B)]。中心卡方连续,不存在端点原子。使用带误差的CDF与正态CDF时,将它们的包含误差也传播进去。

这个办法不只是停机希望。由EV=ν及Markov不等式,尾质量至多ν/B;若网格宽度至多h,则v的变化至多h,而Φ的导数至多1/2π。主区间上下和之差因而至多|t|h/(2πν)。先增大B、再减小h,便可达到任意预设正误差;t=0直接返回Φ(−δ)。这是保守的存在性与计算接口,不是高效数值实现的最优复杂度声明。

若内部概率p∈(0,1)的分位数要达到精度ε>0,先向左右扩展搜索,并收紧CDF误差,直到认证F(a)<p<F(b);两端极限为0、1保证能找到这样的有限括界。单纯只检查中点存在一个停机陷阱:若中点恰为真实分位数,再小的包含误差也可能跨过p。

可以同时检查x1=a+(b−a)/3、x2=a+2(b−a)/3,逐轮将两处CDF误差减半。严格递增使它们不能同时满足F(xi)=p,所以至少一处最终能认证F(xi)<p或F(xi)>p。前者更新左端为xi,后者更新右端为xi;每次都保留真实分位数,而且宽度至多乘2/3。初宽为W时,至多max{0,⌈log⁡(W/ε)/log⁡(3/2)⌉}次已认证更新便达到目标。每次更新可能需要不同次数和精度的CDF评估,这部分成本另计;没有可靠包含时应保留未认证括界。

四自由度的可复算闭式 ​

ν=4时可避免数值积分。对任意实t,δ,令

A=4+t2,b=tδA,q=tδA,K=e−2δ2/AA.

则

(16)F4,δ(t)=Φ(−δ)+tK[(1+2b2+2A)Φ(q)+2bAϕ(q)].

证明从R=V/4开始。其上尾为P(R>r)=(1+2r2)e−2r2。在式(8)中分部积分,CDF成为Φ(−δ)+t(J0+2J2),其中

Jj=∫0∞rje−2r2ϕ(tr−δ)dr.

配方并令z=A(r−b),有J0=KΦ(q)。再利用

∫−q∞zϕ(z)dz=ϕ(q),∫−q∞z2ϕ(z)dz=Φ(q)−qϕ(q),

得到J2=K{(b2+1/A)Φ(q)+(b/A)ϕ(q)},即式(16)。这些积分恒等式由ϕ′(z)=−zϕ(z)直接分部积分得到。

正态容忍上界把总体含量要求变成非中心t分位数;五样本时正好使用式(16)。等效性检验的两个单侧功效也可用本页接口计算,但它们共享均值与样本尺度,整体同时通过的概率一般不能用两份边缘功效相乘。

参考资料
  • R Core Team,官方stats参考:非中心卡方、非中心t、F分布,定义、参数与计算来源部分。本文另给矩母函数证明、遗漏质量包围与四自由度闭式。
  • Norman L. Johnson、Samuel Kotz、N. Balakrishnan,Continuous Univariate Distributions,Vol.2,第2版,1995,Chs.29–31,非中心χ²、F和t。数值近似算法有各自精度范围,正文的概率定义不依赖软件输出多少小数位。
关系图谱17 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系