Skip to content

定义Definition

Kendall τ 秩相关

Kendall tau · Concordance rank correlation

以两个独立观测对之间的同向和反向排序概率定义秩关联,并用随机排列推导独立原假设下的精确分布和方差。

形式陈述 ​

两个量是否倾向一起上升,可以用“任取两人,其相对顺序是否一致”来衡量。设 (X,Y) 是二维随机向量,(X′,Y′) 是其独立同分布副本。总体 Kendall 关联定义为下面的有界变量期望:

τ=E[sgn((X−X′)(Y−Y′))],

其中 sgn(0)=0。先假设两个边缘分布连续,因而两独立观测在任一坐标上打平的概率均为零。此时

τ=P(同向对)−P(反向对),−1≤τ≤1.

同向指两个坐标差同号,反向指异号。给定 n≥2 个独立同分布观测对 (Xi,Yi),样本统计量为

τ^=1(n2)∑i<jsgn((Xi−Xj)(Yi−Yj))=C−D(n2),

C,D 分别为同向对数和反向对数。每一项都有相同期望,所以 Eτ^=τ。它只依赖两个坐标的排序次序,不依赖距离单位。

直觉

Pearson 型线性相关会关注离均值多远;Kendall 统计量只问两个观测的相对次序是否一致。对一对观测,同向记 +1,反向记 −1,最后平均。

对任一坐标施加严格递增变换,所有差值的符号不变,所以 τ 不变。对一个坐标施加严格递减变换,则所有符号反转,τ 变号。它衡量的是单调排序关联,而不是只针对直线形状的关联。

样本虽然产生 (n2) 对比较,但这些比较大量共享观测。不能把它们当成独立投票来估计方差;下面的随机排列推导会正确处理这类依赖。

例子与边界

四个观测,六次比较 ​

取

X=(1,2,3,4),Y=(1,3,4,2).

按 X 从小到大看 Y,只有 (3,2) 和 (4,2) 这两对顺序反向,其余四对同向。因此

C=4,D=2,τ^=4−26=13.

这只是样本关联。若要检验总体独立,四个 Y 在四个 X 位置上的 4!=24 种排列等可能。其反向对数 0,1,…,6 的排列数为

1,3,5,6,5,3,1.

以 |τ^| 为双侧极端程度,有 18 种排列达到至少 1/3,所以精确 p 值为 18/24=0.75。小样本中的正关联数值不等于强证据。

零关联不等于独立 ​

若 X 均匀分布于 (−1,1),令 Y=X2。两个边缘均连续,但 Y 由 X 完全决定,显然不独立。另一方面,

sgn[(X−X′)(X2−X′2)]=sgn(X+X′)

几乎处处成立,因为 (X−X′)2>0。X+X′ 关于零对称,所以 τ=0。左半边下降、右半边上升的关系在同向计数中抵消了。

因此用独立原假设的排列分布校准检验,检验的是独立性这一充分条件;它并非对所有满足 τ=0 但可能依赖的总体都具有相同水平。也不能因未拒绝就宣称两变量独立。

并列时区分 tau-a 与 tau-b ​

有并列时,仍按所有 (n2) 对作分母得到 tau-a;打平的比较贡献零。常见的 tau-b 另外按可比较程度归一化:若 TX 为只在 X 上并列的对数,TY 为只在 Y 上并列的对数,则

τ^b=C−D(C+D+TX)(C+D+TY).

同时在两坐标上并列的对不计入 TX,TY。无并列时它回到本页前面的公式;某个坐标全部相同则分母为零,关联系数未定义。

有并列时不能使用无并列的精确排列表或下述无并列方差。不过在独立原假设下,固定两列观测并置换其中一列仍可进行有效的条件检验,实际并列结构也会随每次配对进入统计量。

推论与应用

独立性怎样变成随机排列 ​

连续边缘保证两列都能无歧义排序。按 X 的秩固定观测顺序;若 X,Y 独立,Y 的秩在这些位置上就是 n! 个排列之一,且各排列等可能。这给出直接的配对置换检验。

记排列的逆序数为 I,它恰等于反向对数 D。由于 C+D=(n2),

τ^=1−4In(n−1).

注意置换的是两列之间的配对关系;若把每个完整观测对一起换位置,所有成对顺序关系不变,统计量根本不会改变。

用逐次插入推导精确方差 ​

均匀随机排列可以递推生成:先放数字 1,再把 j 独立、均匀地插入已有 j−1 个数字的 j 个空位。因为 j 最大,新产生的逆序数 Vj 就是它右边的数字个数,均匀分布于 0,…,j−1,且各步独立。因此

I=∑j=1nVj,EVj=j−12,Var(Vj)=j2−112.

求和得到

EI=n(n−1)4,Var(I)=n(n−1)(2n+5)72.

代回 τ^ 的表达式,独立且无并列时

E0τ^=0,Var0(τ^)=2(2n+5)9n(n−1).

精确逆序数分布的概率生成函数为

E0zI=1n!∏j=1n(1+z+⋯+zj−1),

n=4 时展开即得前面的七项频数。大样本时,各独立插入量的最大范围为 O(n),总标准差为 O(n3/2),所以任意固定阈值下,归一化单项最终都小于该阈值,满足独立三角阵的 Lindeberg 条件。这给出标准化 τ^ 的正态近似;小样本则可直接使用精确分布。

解释与校准分开报告 ​

报告 τ^=1/3 描述的是同向对比反向对多了全部比较的三分之一。报告独立性检验的 p=0.75 描述的是,在独立参考机制下这个样本结果有多常见。一个是效应描述,一个是抽样证据,不能互相替代;存在并列时还应说明报告 tau-a 还是 tau-b。

参考资料
  • SciPy 官方文档,《kendalltau》,Notes 的 tau-b 定义、双重并列处理及精确计算限制。
  • SciPy 官方教程,《Kendall’s tau test》,独立原假设、无并列方差与配对置换校准。
关系图谱17 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系