Skip to content

方法Method

Kolmogorov–Smirnov 检验

Kolmogorov-Smirnov test · KS test

以经验分布和预先指定连续分布之间的最大垂直距离检验拟合,并区分精确均匀校准、有限样本保证与 Brownian 桥近似。

形式陈述 ​

观测值是否符合一条事先给定的分布曲线?单样本 Kolmogorov–Smirnov 检验是一种拟合优度检验。设 n≥1,X1,…,Xn 为独立同分布样本,要检验

H0:F=F0,

其中 F0 是事先完全指定的连续分布函数,不含用这批样本拟合的未知参数。以经验分布函数 Fn 定义

Dn=supx∈R|Fn(x)−F0(x)|.

大值意味着经验曲线至少在某处离原假设很远,因此拒绝域取 Dn>cn,α。若临界值按原假设分布选到 P0(Dn>cn,α)≤α,检验水平就不超过 α。

令 ui=F0(X(i)),其中 X(i) 为次序统计量。在原假设下几乎必然没有并列,且

Dn+=max1≤i≤n(in−ui),Dn−=max1≤i≤n(ui−i−1n),Dn=max(Dn+,Dn−).

这两个最大值分别检查经验阶梯跳跃之后和之前,少查一侧会改变统计量。

直觉

经验分布是一条每次上升 1/n 的阶梯;F0 是要比较的曲线。KS 只问整张图上最宽的垂直缝隙有多大,不把不同位置的缝隙相加。Cramér–von Mises 检验则按总体概率累积平方缝隙;一处较大偏差与多处持续偏差,可能让两种统计量给出相反的异常程度排序。

连续原假设允许把横轴换成概率坐标 u=F0(x)。不论原来的单位是秒、米还是别的量,变换后的观测在原假设下都是独立均匀点,参考曲线都变成对角线。因此临界值只依赖样本量和显著性水平,而不依赖 F0 的具体形状。

“分布无关”来自这个精确变换,绝不是说原假设可以随便改、数据可以相关,或者参数可以在同一批数据上任意估计。

例子与边界

五个点,左右两侧都要看 ​

假设原假设为单位区间均匀分布,排序后的数据是

0.08, 0.26, 0.49, 0.72, 0.95.

跳跃后差值 i/5−ui 依次为 0.12,0.14,0.11,0.08,0.05;跳跃前差值 ui−(i−1)/5 依次为 0.08,0.06,0.09,0.12,0.15。因此

D5+=0.14,D5−=0.15,D5=0.15.

最大的负向差发生在最后一个点的左侧极限。只计算 |i/n−ui| 会误报为 0.14。

三种校准不能混称“精确” ​

第一种直接使用 n 个独立均匀点得到的 Dn 分布,可计算精确有限样本临界值。也可用原假设模拟近似这个分布,但有限模拟本身有误差;若采用包含原样本在内的交换秩 Monte Carlo 检验,需要按该程序的秩规则计算 p 值。

第二种使用 DKW 不等式:取

cn,α=log⁡(2/α)2n

便有有限样本水平上界 α,但一般偏保守。

第三种使用下面的桥极限,例如大样本 5% 临界值约为 1.3581/n。这是渐近校准,不是每个 n 的精确分位数。三种方法可能给出相近数值,却有不同的保证。

拟合参数与离散总体 ​

若先估计正态均值、方差,再比较 Fn 与 Φ((x−X¯)/σ^),拟合已经让两条曲线更接近。变换后的点不再是独立均匀样本,标准 KS 表不能原样使用;须针对估计过程重新校准,例如在每次原假设模拟中重新拟合参数。

若 F0 离散,F0(Xi) 也不均匀。Dn 仍可定义,但精确原假设分布依赖跳跃大小。此时可以按那个离散原假设模拟,或使用仍适用的 DKW 保守界,不能套连续分布无关的精确表。

推论与应用

为什么最大差只需检查跳跃两侧 ​

在两个相邻样本之间,Fn 固定,F0 单调增加。于是 Fn−F0 在区间左端最大,F0−Fn 在右端左极限最大。遍历所有区间,并检查两端无穷远处为零的差,就得到上面的两个有限最大值公式。

连续 F0 下的概率积分变换给出 Ui=F0(Xi)∼Unif(0,1)。连续分布即使有平坦段,也只会在原假设概率零的空区间上不严格增加;这不影响统计量的几乎处处变换及分布无关性。

从指数间距走到经验 Brownian 桥 ​

这里需要整条经验曲线的极限,不能只对每个固定阈值应用中心极限定理。下面把它还原为已经证明的随机游走极限。

令 m=n+1,取独立率一指数变量 E1,…,Em,Sj=∑k=1jEk。均匀间距的指数表示说明 (S1/Sm,…,Sn/Sm) 与均匀样本的有序值同分布。令 Qn 连接点 (j/m,Sj/Sm),0≤j≤m,作严格递增的分段线性插值。

对中心化增量 Ej−1 应用随机游走 Donsker 定理。若 Wm 是归一化中心化部分和的线性插值,则在连续路径的一致范数下

Rn(t):=m[Qn(t)−t]=Wm(t)−tWm(1)Sm/m ⇒ W(t)−tW(1)=B(t).

分母趋于一,极限是标准 Brownian 桥。因此 ‖Qn−id‖∞=OP(m−1/2),逆函数也与恒等函数一样近,并且有精确关系

m[Qn−1(t)−t]=−Rn(Qn−1(t)).

Rn 收敛到连续过程意味着其小尺度振荡统一可控;将趋于恒等的随机时间代入,不改变极限。因此右边与 −Rn(t) 的一致距离依概率趋于零。

若 Gn 是对应均匀样本的经验分布,则在每个相邻有序点之间直接比较可得

‖Gn−Qn−1‖∞≤1n+1.

于是 n(Gn−id) 与一列收敛到 −B 的连续过程一致接近。−B 与 B 同分布,故最大值泛函给出

nDn⇒K:=sup0≤t≤1|B(t)|.

经验过程自身有跳跃,不能把它直接当作 C[0,1] 的元素;上面的连续近似说明了为何仍可对一致连续的路径泛函取极限。

桥的最大值给出渐近临界值 ​

标准桥的双侧最大值分布为,对 z>0,

P(K≤z)=1−2∑j=1∞(−1)j−1e−2j2z2.

这一桥穿越公式可由两侧反射或越界路径分解得到;本页将它作为桥最大值的已知公式使用。代入 z≈1.3581 得到约 0.95 的累计概率。决定 KS 渐近分布的是整条桥的最大偏离,而非某个固定位置的普通正态变量。

参考资料
关系图谱20 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系