形式陈述
两个量是否倾向一起上升,可以用“任取两人,其相对顺序是否一致”来衡量。设 是二维随机向量公理库随机向量Random vector · 多维随机变量一次随机试验同时输出有限多个实坐标所形成的可测映射。, 是其独立同分布副本公理库独立同分布样本IID sample · Independent and identically distributed sample以乘积分布描述来自同一总体的独立重复观测。。总体 Kendall 关联定义为下面的有界变量期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。:
其中 。先假设两个边缘分布连续,因而两独立观测在任一坐标上打平的概率均为零。此时
同向指两个坐标差同号,反向指异号。给定 个独立同分布观测对 ,样本统计量为
分别为同向对数和反向对数。每一项都有相同期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。,所以 。它只依赖两个坐标的排序次序公理库顺序统计量Order statistic有限样本按键排序后第 k 个位置的值,保留重复出现的次数。,不依赖距离单位。
直觉
Pearson 型线性相关会关注离均值多远;Kendall 统计量只问两个观测的相对次序是否一致。对一对观测,同向记 ,反向记 ,最后平均。
对任一坐标施加严格递增变换,所有差值的符号不变,所以 不变。对一个坐标施加严格递减变换,则所有符号反转, 变号。它衡量的是单调排序关联,而不是只针对直线形状的关联。
样本虽然产生 对比较,但这些比较大量共享观测。不能把它们当成独立投票来估计方差;下面的随机排列推导会正确处理这类依赖。
例子与边界
四个观测,六次比较
取
按 从小到大看 ,只有 和 这两对顺序反向,其余四对同向。因此
这只是样本关联。若要检验总体独立,四个 在四个 位置上的 种排列等可能。其反向对数 的排列数为
以 为双侧极端程度,有 种排列达到至少 ,所以精确 值为 。小样本中的正关联数值不等于强证据。
零关联不等于独立
若 均匀分布于 ,令 。两个边缘均连续,但 由 完全决定,显然不独立公理库独立性Statistical independence从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。。另一方面,
几乎处处成立,因为 。 关于零对称,所以 。左半边下降、右半边上升的关系在同向计数中抵消了。
因此用独立原假设的排列分布校准检验,检验的是独立性这一充分条件;它并非对所有满足 但可能依赖的总体都具有相同水平。也不能因未拒绝就宣称两变量独立。
并列时区分 tau-a 与 tau-b
有并列时,仍按所有 对作分母得到 tau-a;打平的比较贡献零。常见的 tau-b 另外按可比较程度归一化:若 为只在 上并列的对数, 为只在 上并列的对数,则
同时在两坐标上并列的对不计入 。无并列时它回到本页前面的公式;某个坐标全部相同则分母为零,关联系数未定义。
有并列时不能使用无并列的精确排列表或下述无并列方差。不过在独立原假设下,固定两列观测并置换其中一列仍可进行有效的条件检验,实际并列结构也会随每次配对进入统计量。
推论与应用
独立性怎样变成随机排列
连续边缘保证两列都能无歧义排序。按 的秩固定观测顺序;若 独立, 的秩在这些位置上就是 个排列之一,且各排列等可能。这给出直接的配对置换检验公理库置换检验Permutation test · Randomization test利用零假设下数据对一组变换的分布不变性,构造有限样本精确检验。。
记排列的逆序数为 ,它恰等于反向对数 。由于 ,
注意置换的是两列之间的配对关系;若把每个完整观测对一起换位置,所有成对顺序关系不变,统计量根本不会改变。
用逐次插入推导精确方差
均匀随机排列可以递推生成:先放数字 ,再把 独立、均匀地插入已有 个数字的 个空位。因为 最大,新产生的逆序数 就是它右边的数字个数,均匀分布于 ,且各步独立。因此
求和得到
代回 的表达式,独立且无并列时
精确逆序数分布的概率生成函数为
时展开即得前面的七项频数。大样本时,各独立插入量的最大范围为 ,总标准差为 ,所以任意固定阈值下,归一化单项最终都小于该阈值,满足独立三角阵的 Lindeberg 条件。这给出标准化 的正态近似;小样本则可直接使用精确分布。
解释与校准分开报告
报告 描述的是同向对比反向对多了全部比较的三分之一。报告独立性检验的 描述的是,在独立参考机制下这个样本结果有多常见。一个是效应描述,一个是抽样证据,不能互相替代;存在并列时还应说明报告 tau-a 还是 tau-b。
参考资料