形式陈述
令 X 1 , … , X n 是来自 P 的IID样本 理路 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,n ≥ 2 。给定实值、可测、对称核 h ( x , y ) = h ( y , x ) ,先假设 E | h ( X 1 , X 2 ) | < ∞ 。目标和二阶U统计量为
θ = E h ( X 1 , X 2 ) , U n = ( n 2 ) − 1 ∑ 1 ≤ i < j ≤ n h ( X i , X j ) . 核中的两个位置应是独立抽样。每一项期望都是 θ ,故 E U n = θ ,但不同核值可能共享一个输入,通常不独立。( n 2 ) 是核求值次数,不是独立样本量。
以下方差和极限定理进一步假设 E h ( X 1 , X 2 ) 2 < ∞ 。用条件期望 理路 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 定义
h 1 ( x ) = E [ h ( x , X 2 ) ] − θ , h 2 ( x , y ) = h ( x , y ) − θ − h 1 ( x ) − h 1 ( y ) . 积分版本在 P 几乎处处意义下定义即可。条件期望的平方可积性保证两部分也在 L 2 。它们满足
E h 1 ( X ) = 0 , E [ h 2 ( X 1 , X 2 ) ∣ X 1 ] = 0 , 对第二个坐标也如此。最后这个条件称为二阶余项退化;它比单纯的总体均值为零更强。记 ζ 1 = E h 1 ( X ) 2 、ζ 2 = E h 2 ( X 1 , X 2 ) 2 。
精确分解与方差
将核分解代入所有对的和。每个 h 1 ( X i ) 恰好出现 n − 1 次,所以
U n − θ = 2 n ∑ i = 1 n h 1 ( X i ) + ( n 2 ) − 1 ∑ i < j h 2 ( X i , X j ) . 第一项称为一阶投影,第二项记为 R n 。它们不必独立,但正交:任一 h 1 ( X i ) 与包含该索引的余项核,其乘积期望因条件均值为零而消失;索引不相交时由独立性消失。
不同余项核之间也不相关。如果两对无共同索引,由独立性可知;若例如共享 X 1 ,给定 X 1 后,X 2 , X 3 独立,而且两个核的条件均值都为零,故
E [ h 2 ( X 1 , X 2 ) h 2 ( X 1 , X 3 ) ] = 0. 逐项用协方差展开 理路 协方差 Covariance 两个随机变量中心化乘积的期望,衡量线性共同变化。 ,得到精确公式
Var ( U n ) = 4 ζ 1 n + 2 ζ 2 n ( n − 1 ) . 这已经说明,非退化时主要误差通常仍为 n − 1 / 2 ,不是核行数平方根对应的 n − 1 。共享索引的原核协方差为
Cov ( h ( X 1 , X 2 ) , h ( X 1 , X 3 ) ) = ζ 1 , 因为给定 X 1 后原核的条件均值是 θ + h 1 ( X 1 ) 。两种计算给出同一依赖机制。
非退化时的正态结论
若 ζ 1 > 0 ,则 n E R n 2 = 2 ζ 2 / ( n − 1 ) → 0 ,故 n R n → P 0 。对IID单观测贡献 2 h 1 ( X i ) 用中心极限定理 理路 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 ,再由Slutsky定理 理路 Slutsky 定理 Slutsky's theorem 依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。 ,得到
n ( U n − θ ) ⇒ N ( 0 , 4 ζ 1 ) . 这给出完整机制:先把成对依赖压缩到一阶独立和,再证明余项在相同尺度下可忽略。若 ζ 1 = 0 ,这一论证只给退化零极限,并未提供有用的正态误差条;此时须检查第二阶结构。
直觉
一个偏大的 X i 可能让与它连接的许多核值同时偏大。把这些核值逐行当独立,等于把同一份信息重复计数。一阶投影量出“单独知道这个 X i ,全部成对平均会被推向哪个方向”;退化余项则是不靠任何单个观测就能解释的交互部分。
图片加载失败 成对行数与独立输入数 退化不等于统计量恒为零。它仅表示平均偏移不能由单个坐标解释,剩余的二阶相互作用可能仍显著,而且具有另一种尺度与分布。
例子与边界
样本方差正是一个二阶U统计量
设 E X = μ 、Var ( X ) = σ 2 ,取 h ( x , y ) = ( x − y ) 2 / 2 。独立性使 E h ( X 1 , X 2 ) = σ 2 。代数恒等式
∑ i < j ( x i − x j ) 2 = n ∑ i ( x i − x ¯ ) 2 可由展开左右两边并使用 ∑ i < j x i x j = ( ( ∑ i x i ) 2 − ∑ i x i 2 ) / 2 证明。因此 U n 恰为分母 n − 1 的样本方差。对数据 ( 0 , 1 , 3 ) ,三个核值为 ( 1 / 2 , 9 / 2 , 2 ) ,平均 7 / 3 ;直接计算围绕均值 4 / 3 的平方差除以2,也得到 7 / 3 。
若再有四阶中心矩 μ 4 = E ( X − μ ) 4 < ∞ ,令 a = x − μ , b = y − μ ,可算出
h 1 ( x ) = ( x − μ ) 2 − σ 2 2 , h 2 ( x , y ) = − ( x − μ ) ( y − μ ) . 故 ζ 1 = ( μ 4 − σ 4 ) / 4 、ζ 2 = σ 4 ,样本方差的精确方差为
Var ( U n ) = μ 4 − σ 4 n + 2 σ 4 n ( n − 1 ) . 以标准正态为例,σ 2 = 1 , μ 4 = 3 ,真实方差为 2 / ( n − 1 ) 。单个核 h ( X 1 , X 2 ) 的方差为2,若错误地把全部 ( n 2 ) 个核值当IID,会得到 4 / [ n ( n − 1 ) ] ,少了 n / 2 倍;n = 10 时真实值 2 / 9 ,错误值 2 / 45 。问题不在核行数算少了,而在忽略了共享输入。
一个完全可解的退化反例
令 X i 独立地以等概率取 − 1 , + 1 ,核 h ( x , y ) = x y 。目标 θ = 0 ,且 E [ h ( x , X 2 ) ] = x E X 2 = 0 ,所以 h 1 = 0 ,h 2 = h 。于是
U n = ( ∑ i X i ) 2 − n n ( n − 1 ) , Var ( U n ) = 2 n ( n − 1 ) . 方差是 n − 2 阶,但极限不是正态。由IID CLT及连续映射定理 理路 连续映射定理 Continuous mapping theorem · Mann–Wald theorem 当可测映射的不连续点不承载极限概率时,沿它推前保留弱收敛;阈值映射说明边界质量为何决定成败。 ,
n U n = n n − 1 [ ( ∑ i X i n ) 2 − 1 ] ⇒ Z 2 − 1 , Z ∼ N ( 0 , 1 ) . 这条极限下界为 − 1 ,明显不对称。以四条输入 ( − 1 , − 1 , 1 , 1 ) 为例,六个核值之和为 − 2 ,U 4 = − 1 / 3 ;退化核仍可给出负估计值;其 ζ 1 = 0 ,因而不满足上节非退化正态结论的条件。
有限二阶观测矩不等于有限二阶核矩
样本方差核需要检查 E h 2 ,它涉及观测的四阶矩。若观测只有有限方差、四阶矩无穷,样本方差仍可无偏并一致,但本页的有限方差公式和普通根号样本量CLT不再由上述证明支持。应检查统计量核的矩条件,不能只看原始 X 的方差是否有限。
推论与应用
用行均值估计投影,而不是把核行当样本
定义每个观测连接的核平均
r i = 1 n − 1 ∑ j ≠ i h ( X i , X j ) , h ^ 1 i = r i − U n , ζ ^ 1 = 1 n ∑ i h ^ 1 i 2 . 注意 n − 1 ∑ i r i = U n ,故这些估计投影的样本均值恰为零。条件于 X i ,组成 r i 的其他输入独立,因此
E [ 1 n ∑ i { r i − θ − h 1 ( X i ) } 2 ] = E Var ( h ( X 1 , X 2 ) ∣ X 1 ) n − 1 → 0. 精确方差式使 U n → P θ ,上式控制投影的经验平方误差,再以Cauchy–Schwarz不等式 理路 Cauchy–Schwarz 不等式 Cauchy–Schwarz inequality · 柯西–施瓦茨不等式 内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。 和 h 1 ( X i ) 2 的大数律 理路 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 即可推出 ζ ^ 1 → P ζ 1 。因此非退化时可用 2 ζ ^ 1 / n 作渐近标准误;它不是有限样本无偏标准差,在退化情形也没有正确校准的保证。
计算接口与适用范围
输入为 n 个独立观测、对称核和目标核期望的解释。逐个访问 i < j ,核值同时加进总和与两个端点的行和;完成后总计恰有 n ( n − 1 ) / 2 个无序对,每个行和恰含 n − 1 项。这是实现的不变量,能检查漏对、重复计数和分母错误。
一般核需 O ( n 2 ) 次求值;除保存输入外,若需要投影标准误,存 n 个行和,额外存储 O ( n ) ,不必保存整个核矩阵。仅求均值时总和本身为 O ( 1 ) 额外累加状态。样本方差利用上面的恒等式可降为 O ( n ) ,说明核形式不等于必须使用二重循环。若预算不足而只取部分对,就得到另一个估计规则,其额外抽对误差需单独分析。
MMD 理路 最大均值差异 maximum mean discrepancy · MMD · kernel two-sample discrepancy 以两个核均值之距度量分布差异,并区分总体量、V 统计量、U 统计量与检验校准。 的无偏两样本估计同样出现共享输入与退化结构。但两组大小可不同、跨组项含全部 m n 对,一般不能直接当成本页的一样本二阶核平均。该页保留两样本公式和检验校准;本页提供理解投影与独立单元的基础,而非替换它的全部渐近定理。
两个自测:若核是 h ( x , y ) = ( x + y ) / 2 ,则 h 1 ( x ) = ( x − E X ) / 2 、h 2 = 0 ,U n 恰等于样本均值,方差为 Var ( X ) / n 。若只列出四个观测的六对,就宣称有六个独立观测,错误在独立单位:原始独立随机对象仍只有四个,核行的依赖必须进入方差。
本页在平方可积条件下的投影、方差与非退化极限结论,是固定阶Hoeffding分解 理路 固定阶 U 统计量的 Hoeffding 分解 Hoeffding decomposition of fixed-order U-statistics · Higher-order Hoeffding projection · 高阶U统计量投影 · U统计量退化秩 以子集容斥构造固定阶对称核的正交投影,证明组合系数和精确方差,并用三阶退化核确定非正态尺度及计算预算。 在 m = 2 时的特例;开头仅需一阶可积的定义与无偏性保留其较宽条件。系数 2 和余项系数 1 来自一般组合重数。一般页另证明按任意子集容斥净化的canonical核、各阶正交方差,并计算三阶Rademacher乘积核的 n 3 / 2 尺度与 Z 3 − 3 Z 极限;本页的二阶证明和实例均仍独立可读。
若因核昂贵而只随机取部分对,见不完全U统计量 理路 不完全 U 统计量 Incomplete U-statistic · Subsampled U-statistic · 随机子集核平均 · 不完整U统计量 随机计算部分子集核值,以条件与无条件方差区分计算误差和数据误差,并按投影退化秩确定所需核预算。 。条件于原始资料,均匀有放回抽 B 对的计算方差为核表方差除以 B ;解除条件后还必须加上完整U的资料方差。尤其本页的退化乘积核原方差为 n − 2 阶,线性 B 会把计算误差带回 n − 1 阶,不能照搬非退化问题的预算。
参考资料