“具体检验必须与假设结构匹配。似然比检验适合给定参数模型并能构造受限与非受限极大似然的场景;序贯概率比检验针对两个简单假设边观测边停止;置换检验依赖零假设下的交换性,以重排分布校准有限样本显著…”
形式陈述 ​
在统计检验中,设有限群
在轨道上随机打乱的秩是超均匀的,因此规则
直觉
置换检验不凭空假设一个参数分布,而是利用零假设下标签交换不会改变联合分布这一对称性。把观测数据固定后,所有允许置换形成条件参考分布;“允许哪些置换”由实验设计和交换性决定,而不是任意打乱都合法。
例子与边界
两样本例子 ​
在两组分布完全相同的零假设下,合并
若只计算
保持 Monte Carlo 检验有效;直接用命中数除以
精确性证明与计算轨迹 ​
条件于观测轨道
再对轨道取期望即得无条件 level 控制。这个证明解释了为何必须用整个群作用或正确的随机化分布,而不是随意洗牌。
两样本例设组大小
若只随机抽
把原排列纳入秩,避免报告不可能的零 p 值,并保持 Monte Carlo 检验校准。
边界 ​
精确性依赖交换性或指定随机化机制,不只依赖两组均值相等。异方差但均值相等时,原始标签通常不可交换,均值差置换检验未必有效;studentized permutation 可能渐近有效但不是同一有限样本定理。
配对设计应在配对内换符号或交换,聚类设计应置换整个集群。忽略设计单元会制造不存在的独立性。
零假设只有均值相等但分布或方差不同,不保证标签交换性。studentized 置换统计量在某些条件下渐近有效,却不是原始均值差检验的有限样本精确性。
若先筛选变量、挑最大统计量再置换,必须在每个置换中重做筛选与最大化;只置换最终被选变量会低估选择造成的极端性。
看数据后选择统计量再只置换最终统计量,未复制选择流程。整个数据依赖分析必须在每次置换中重做。
置换分布可用于构造区间:对候选效应
在随机对照试验中,精确性来自已知 treatment assignment mechanism,即使响应不是 iid。观察性两样本比较则通常依赖组间交换性分布假设。相同置换代码可服务两种语境,但概率来源不同。
统计量选择影响 power 而不影响在不变性成立时的基本 level。均值差擅长位置移动,秩统计量对重尾更稳健,最大统计量适合稀疏坐标偏离。看完标签后挑统计量必须在置换中复制选择。
ties 会让轨道统计量重复。使用“至少同样极端”的计数产生保守 p 值;随机打破 ties 可精确均匀,但结果引入额外随机性。mid-p 可能减保守,却不保持一般有限样本超均匀。
计算全排列不可能时,可均匀抽取群元素。抽样算法若偏向某些排列,Monte Carlo p 值失效;受限置换还需确认采样覆盖正确的 block/stratum 群。
Freedman–Lane 等回归置换方案分别置换 residual、response 或 covariate,只有在相应误差交换性与零模型结构下才有效。把任意回归残差洗牌不会自动保持异方差或 leverage pattern。
置换置信区间通过检验反演得到,不等于 bootstrap percentile interval。前者依赖零假设不变群并控制检验错误,后者近似估计量抽样分布;重采样外观相似但逻辑不同。
当轨道规模小于
推论与应用
成组随机试验、配对符号翻转和区组设计对应不同的群作用与置换轨道。若完整枚举不可行,可用 Monte Carlo 置换并把模拟秩的不确定性计入p 值;若交换性只在渐近或模型调整后成立,则需要 studentization 或专门置换定理,不能继续声称有限样本精确。
参考资料
- Phillip Good, Permutation, Parametric, and Bootstrap Tests, 3rd ed., Springer, 2005。
- E. J. G. Pitman, “Significance Tests Which May Be Applied to Samples from Any Populations,” 1937。
- Jesse Hemerik and Jelle Goeman, “Exact Testing with Random Permutations,” TEST 27, 2018。