从经验曲线到秩检验:一份可复核的校准报告
返回“次序、经验分布与秩推断”学习路线
这份终点任务要求写出一份有数字、有条件、有校准依据的报告。主要训练不是选择一个检验名称,而是辨认哪些随机变化在原假设下可以重新生成,以及哪些保证只是大样本近似。
任务一:八次测量究竟支持什么
设八次测量是来自未知连续总体的独立同分布观测,本次得到的八个正测量排序值为 ,其中
拟合优度检查采用事先指定的率一指数分布 ()作为原假设,并不预设未知总体确实服从它。同时希望对该未知连续总体的中位数作不依赖分布形状的推断。
- 算出九个概率间距,并说明它们在原假设下的联合密度、单段均值和两段协方差。求最长间距超过 的原假设概率。
- 计算 KS 与 Cramér–von Mises 统计量。用 DKW 给出一个有限样本 水平的拒绝规则,说明它在这里是否拒绝。
- 在看数据前规定中位数区间为 。算出其精确覆盖率与本次端点;比较 是否达到 。
- 若要使 的整条 CDF 置信带半宽不超过 ,DKW 要求多少观测?
- 另一次独立实验有 个率一指数观测,在真 分位点处有 个观测落在其左侧或等于它。给出样本分位点误差的一阶预测和渐近标准误,并说明二者的性质。
解答一:间距是受总和约束的向量
包括两端点后,九个间距为
它们总和为一,观测最长间距为 。在原假设下,概率坐标是独立均匀样本,间距定理公理库均匀样本的随机间距Uniform spacings · Dirichlet spacings把均匀样本连同两端点之间的间距合起来,得到单纯形上的均匀随机向量,也可由独立指数变量归一化生成。给出前八个自由坐标的密度 ,支持为正单纯形。对任一段及不同两段,
一段大于 的概率为 ;两段不可能同时严格超过 ,所以
本次最大间距未超过该阈值。这只是一个事先规定的间距事件检查,不是由数据直接证明总体均匀。
解答二:曲线距离与保守水平
根据 KS 的两侧跳跃公式公理库Kolmogorov–Smirnov 检验Kolmogorov-Smirnov test · KS test以经验分布和预先指定连续分布之间的最大垂直距离检验拟合,并区分精确均匀校准、有限样本保证与 Brownian 桥近似。,
平方积分统计量公理库Cramér–von Mises 检验Cramer-von Mises test · Cramér-von Mises statistic将经验分布与指定总体分布之间的平方误差按总体概率累积,得到有精确有序值公式的整体拟合优度统计量。则为
二者都只给出距离,不能把数值本身当作 值。利用 DKW 有限样本界公理库Dvoretzky–Kiefer–Wolfowitz 不等式Dvoretzky-Kiefer-Wolfowitz inequality · DKW inequality · DKW-Massart inequality经验分布函数在全部实数阈值上的最大误差具有统一有限样本指数界,可直接形成整条分布函数的置信带。, 水平的保守阈值为
只有 才拒绝,故这次不拒绝。这个阈值大,说明八个观测对整条曲线能给出的统一保证很宽;“未拒绝”不能解释为精确确认指数模型。
作为另一种校准,大样本时有
其中 为标准桥。两者用同一经验桥极限,但应用不同泛函;此处 ,不能把这两条渐近式冒充精确有限样本分布。
解答三:精确中位区间不需要指数模型
设未知总体连续且中位数唯一为 。。固定秩区间公理库分布无关的分位数置信区间Distribution-free quantile confidence interval · Exact order-statistic confidence interval用固定秩的样本次序值夹住总体分位数,覆盖概率精确化为二项计数,无需估计密度或指定分布形状。覆盖 等价于 ,因此
其两侧漏失概率并不相等,但总覆盖率确实至少 。本次端点为
改用 后,覆盖事件为 ,覆盖率降至 ,不足 。不能因为后一个区间看起来更紧,就仍给它贴上 标签;也不能看完间距才在多个固定秩方案中选择最短而不重新分析覆盖率。
解答四:整条曲线的样本量
要求
故 足够。这个数量保证整条 CDF 的最大误差,不是只保证某一个预先指定阈值的比例误差。
解答五:把 CDF 误差反解成分位误差
率一指数分布的 分位点为 ,该点密度 。由 样本分位数的渐近线性化公理库样本分位数的渐近线性化Sample quantile asymptotics · Bahadur representation for a sample quantile在目标分位附近密度连续且为正时,经验分位的随机逆可线性化,余项由局部经验分布振荡控制。,
在本次 实验中,将观测比例 代入,主项为 。这预测分位点在真值左侧,因为到真分位点时经验累计比例已经偏高。它不是由一个累计计数就确定的精确样本分位数。
渐近方差系数为 ,所以标准误近似为
这个标准误使用了指数模型在分位点处的密度;前面固定秩区间的精确覆盖并不需要这样的正密度值。若密度在分位点为零,根号样本量线性化可能失效,但连续总体下的二项秩覆盖仍可成立。
任务二:相同两列数字,两种设计
给定两列 、。
- 若它们来自两个相互独立的总体样本,用“ 较大”为方向计算 Mann–Whitney 计数和双侧精确 值。
- 若它们实际来自三个独立配对,原假设是配对差值独立且关于零对称,计算符号秩的双侧精确 值。解释为什么不能用第一种参考机制替代第二种。
- 回到三个相互独立组的设计,再加入 。计算 Kruskal–Wallis 统计量,精确置换上尾概率,以及卡方近似。
解答六:交换组标签与翻转配对符号
独立两组中,三个 分别胜过 个 ,故 Mann–Whitney 统计量公理库Wilcoxon–Mann–Whitney 秩和检验Wilcoxon rank-sum test · Mann-Whitney U test用两组样本间的成对胜出次数或合并秩和检验共同分布,精确校准来自组标签交换,而中位数解释需要额外条件。 ,中心为 。三对三的二十种标签分配中, 的频数为
达到至少 的双侧距离,即 或 ,共有十四种,因此 。
配对设计下,差值为 ,绝对值秩为 ,正秩和为六。符号秩原假设公理库Wilcoxon 符号秩检验Wilcoxon signed-rank test · Signed-rank test在独立且关于零对称的差值模型下,固定绝对值秩并翻转公平符号,得到配对或单样本位置检验的精确分布。允许固定这三个绝对值,独立翻转三个符号,共八种结果。中心为三,与观测至少一样远的只有全正和全负两种,所以双侧 。
两种 值不同并不矛盾:第一种固定六个观测、交换组标签;第二种固定三个配对距离、翻转方向。实验设计决定哪一种随机化有依据,不能事后选择更小的 值。第二种还需要差值对称,单纯“差值中位数为零”并不足够。
解答七:三个组的秩对比
九个观测合并后, 的秩分别为
秩和为 。于是 Kruskal–Wallis 统计量公理库Kruskal–Wallis 检验Kruskal-Wallis test · Rank-based one-way test把多个独立组的平均秩相对总体平均秩的偏移合成二次统计量,并用标签置换或有条件的卡方近似检验共同分布。为
固定三组大小各三,共有 种标签分配。记三组秩集合为 ;达到观测极端程度等价于
以下整数枚举给出完整可复核计数:
pythonfrom itertools import combinations
ranks = set(range(1, 10))
total = extreme = 0
for A in combinations(sorted(ranks), 3):
remaining = ranks - set(A)
for B in combinations(sorted(remaining), 3):
C = remaining - set(B)
total += 1
extreme += (sum(A)**2 + sum(B)**2 + sum(C)**2 >= 779)
assert (total, extreme) == (1680, 168)
1
2
3
4
5
6
7
8
9
10
所以精确上尾 。 近似给出 ,这次碰巧很接近;接近不是小样本精确性的证明。
结论仅是这些数据尚未给出 水平下拒绝共同分布的证据,不能宣称三个总体相同,更不能从一个整体 值确定哪一对总体均值或中位数不同。
任务三:秩关联与独立性
五个独立观测对为 、。
- 计算 Kendall 样本关联、独立原假设下的精确双侧 值。
- 若把每个 换成 ,哪些结果不变?
- 若某个总体的 Kendall 关联等于零,是否能推出总体独立?给出明确反例。
解答八:逆序计数给出校准
按 次序看 ,四个逆序为 。总共有十对比较,故 Kendall 统计量公理库Kendall τ 秩相关Kendall tau · Concordance rank correlation以两个独立观测对之间的同向和反向排序概率定义秩关联,并用随机排列推导独立原假设下的精确分布和方差。为
独立原假设下,五个 秩在五个 位置上的 种排列等可能。逆序数 的频数为
这些系数由 展开得到。 等价于逆序数不等于五,因此精确双侧 。
指数变换严格递增,不改变任何秩和逆序,所以 与这个精确排列 值都不变。但 Kendall 关联为零不推出独立:取 、,两者有确定函数关系,而两独立副本的比较符号等于 ,期望为零。
验收标准
合格报告应给出九个间距、两种曲线统计量、 的区间覆盖、 的样本量,以及两个设计下不同的合法随机化机制。应能复现三组检验的 和 Kendall 的 ,并把“精确”“保守有限样本”“渐近近似”三类保证逐一标清。任何把未拒绝说成证明原假设、把中位数为零当成差值对称、或把成对比较当成独立观测的报告,都还没有完成本任务。