形式陈述
令 固定,, IID理路独立同分布样本IID sample · Independent and identically distributed sample以乘积分布描述来自同一总体的独立重复观测。来自 。设 为实值可测对称 元核且 ,目标为 ,完整U统计量为
核的参数按索引升序排列;由于对称性,次序不影响结果。固定 很重要:以下渐近阶的常数依赖 ,不能未经控制推广到 。
对 ,定义 ,其中 。对每个 元输入,令
时 。条件期望理路条件期望Conditional expectation以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。的 收缩与有限求和保证各 。对称性保证这些版本可以选为对称;等式均按 的相应乘积测度几乎处处理解。
容斥为何给出退化且完整的分解
先固定一个 ,对最后一个坐标积分。把子集 成对分为不含 的 与包含 的 。IID乘积结构使后者积分后变成 ,其符号与前者相反,逐对消去。因此
同理可对任一坐标积分为零,进而条件于任一真子集时均值也为零;这称为canonical或完全退化的 阶核。
再把 展开。固定一个子集 的 ,其系数为
只有 留下系数1,所以
将它放进所有 子集的平均中,一个固定 子集在 个大子集中出现。组合恒等式
给出精确分解
正交性与精确方差
两个不同索引集合 上的canonical项 、 不相关:在对称差中选一个只属于一方的坐标,给定其余所有坐标,另一方不变,前者按退化性质积分为零。不同阶的集合必不相同,同阶不同集合也如此。它们一般不独立,但零协方差已经足以使用协方差展开理路协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。计算方差。
记 ,则
设第一个非零投影为 ,即 、,称 为退化秩。固定核与固定阶下,
这确定方差尺度,却没有自动确定极限分布。 时,一阶IID和主导,其余方差为 ,故由CLT理路中心极限定理Central limit theorem适当归一化的独立随机变量和在分布上趋于正态分布。与Slutsky理路Slutsky 定理Slutsky's theorem依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。得到 。 时需新的极限机制,不能把 尺度误读成正态保证。
直觉
单个观测解释的一阶效应、只有成对出现才显现的二阶交互、必须三个一起出现才显现的三阶交互,要依次剥离。直接使用 会把低阶效应重复放进高阶,只有容斥才把每一部分净化为“缺任一坐标便平均为零”。
二阶旧页理路二阶 U 统计量与一阶投影Order-two U-statistic and Hoeffding projection · 二阶U统计量 · Hoeffding一阶投影把所有成对核值的平均分解为单观测投影和退化余项,精确计算共享样本造成的方差,并区分根号样本量正态与退化尺度。已经完整证明共享一个索引的协方差、一阶投影和二阶余项。本页复用其思想,但新增任意子集的容斥与组合重数,并实际解决三阶退化任务;不是把旧证明中的2机械改成 。
例子与边界
同一个三元核同时含三种尺度
令 等概率取 ,取
由于 、,,各canonical投影为 、、。例如 ,只有减去两个 才留下真正二阶项。精确方差为
时为 。单核方差为 ;把20个三元核行当IID会算成 ,明显少算。改变 会改变首个非零投影: 时为二阶尺度, 时为三阶尺度。
三阶退化:Hermite多项式而非正态
取 ,仍用Rademacher输入。目标零,前两阶投影都为零,,故
令 。展开 ,三索引互异的项计六次,两索引相同的项合计 ,三者相同的项为 。因此
例如 、样本 时,,统计量为 。枚举全部32个等概率样本,可验证均值0、方差 。这里10个三元核值两两不相关,却依然不是相互独立。
IID CLT给 ,上述恒等式与连续映射理路连续映射定理Continuous mapping theorem · Mann–Wald theorem当可测映射的不连续点不承载极限概率时,沿它推前保留弱收敛;阈值映射说明边界质量为何决定成败。给
极限均值0、方差 ,与 一致。它虽关于零对称,也不是正态:四阶矩为3348,而方差6的正态四阶矩为108。对称与有限方差都不足以恢复正态误差条。
退化取决于分布,不只是核表达式
一般IID输入均值为 ,核仍是 ,目标为 。写 后,投影为
当 , 时为秩1; 时为秩3。不能因为某份数据的样本均值接近零,就把总体投影宣布为严格退化。参数随 趋零时的过渡尺度也不由固定参数CLT统一覆盖。
推论与应用
先找投影秩,再谈昂贵核预算
完整三元核通常需 次求值,但上面的特殊乘积核可由 的恒等式降为线性时间。遇到昂贵一般核,应先检查代数化简;如果确需只计算部分子集,不完全U统计量理路不完全 U 统计量Incomplete U-statistic · Subsampled U-statistic · 随机子集核平均 · 不完整U统计量随机计算部分子集核值,以条件与无条件方差区分计算误差和数据误差,并按投影退化秩确定所需核预算。会再引入计算抽样误差。
这时退化秩具有实际成本意义:若完整统计量方差为 阶,而有放回抽 个子集引入 阶误差,要保留原方差阶至少需要 达到 量级。非退化核常见的线性计算预算不能无条件搬到三阶退化核。精确公式与不放回修正见该页。
适用范围检查
这里的 是总体分布下的理论投影,通常未知;用数据估计它们需另做一致性与标准误分析。本文给精确分解和尺度,不交付任意阶退化核的通用学生化算法,也不保证所有核都有可计算的闭式投影。
条件独立是正交证明的关键。样本来自时间序列、只交换而不独立,或把若干来自同一外层情境的输出当作独立 ,都可能破坏“积分一个独有坐标便为零”的步骤。多样本U统计量还要分组计算重数,不能直接用 替代;MMD理路最大均值差异maximum mean discrepancy · MMD · kernel two-sample discrepancy以两个核均值之距度量分布差异,并区分总体量、V 统计量、U 统计量与检验校准。原页保留其两样本结构。
自测:若 ,则 、其余投影为零,完整U恰为样本均值,方差为 。若 且 ,只有第 阶投影非零,方差为 ;但极限分布还需单独推导,不能由这个方差公式直接命名。
参考资料