Skip to content

定理Theorem

二阶 U 统计量与一阶投影

Order-two U-statistic and Hoeffding projection · 二阶U统计量 · Hoeffding一阶投影

把所有成对核值的平均分解为单观测投影和退化余项,精确计算共享样本造成的方差,并区分根号样本量正态与退化尺度。

形式陈述 ​

令 X1,…,Xn 是来自 P 的IID样本,n≥2。给定实值、可测、对称核 h(x,y)=h(y,x),先假设 E|h(X1,X2)|<∞。目标和二阶U统计量为

θ=Eh(X1,X2),Un=(n2)−1∑1≤i<j≤nh(Xi,Xj).

核中的两个位置应是独立抽样。每一项期望都是 θ,故 EUn=θ,但不同核值可能共享一个输入,通常不独立。(n2) 是核求值次数,不是独立样本量。

以下方差和极限定理进一步假设 Eh(X1,X2)2<∞。用条件期望定义

h1(x)=E[h(x,X2)]−θ,h2(x,y)=h(x,y)−θ−h1(x)−h1(y).

积分版本在 P 几乎处处意义下定义即可。条件期望的平方可积性保证两部分也在 L2。它们满足

Eh1(X)=0,E[h2(X1,X2)∣X1]=0,

对第二个坐标也如此。最后这个条件称为二阶余项退化;它比单纯的总体均值为零更强。记 ζ1=Eh1(X)2、ζ2=Eh2(X1,X2)2。

精确分解与方差 ​

将核分解代入所有对的和。每个 h1(Xi) 恰好出现 n−1 次,所以

Un−θ=2n∑i=1nh1(Xi)+(n2)−1∑i<jh2(Xi,Xj).

第一项称为一阶投影,第二项记为 Rn。它们不必独立,但正交:任一 h1(Xi) 与包含该索引的余项核,其乘积期望因条件均值为零而消失;索引不相交时由独立性消失。

不同余项核之间也不相关。如果两对无共同索引,由独立性可知;若例如共享 X1,给定 X1 后,X2,X3 独立,而且两个核的条件均值都为零,故

E[h2(X1,X2)h2(X1,X3)]=0.

逐项用协方差展开,得到精确公式

Var(Un)=4ζ1n+2ζ2n(n−1).

这已经说明,非退化时主要误差通常仍为 n−1/2,不是核行数平方根对应的 n−1。共享索引的原核协方差为

Cov(h(X1,X2),h(X1,X3))=ζ1,

因为给定 X1 后原核的条件均值是 θ+h1(X1)。两种计算给出同一依赖机制。

非退化时的正态结论 ​

若 ζ1>0,则 nERn2=2ζ2/(n−1)→0,故 nRn→P0。对IID单观测贡献 2h1(Xi) 用中心极限定理,再由Slutsky定理,得到

n(Un−θ)⇒N(0,4ζ1).

这给出完整机制:先把成对依赖压缩到一阶独立和,再证明余项在相同尺度下可忽略。若 ζ1=0,这一论证只给退化零极限,并未提供有用的正态误差条;此时须检查第二阶结构。

直觉

一个偏大的 Xi 可能让与它连接的许多核值同时偏大。把这些核值逐行当独立,等于把同一份信息重复计数。一阶投影量出“单独知道这个 Xi,全部成对平均会被推向哪个方向”;退化余项则是不靠任何单个观测就能解释的交互部分。

成对行数与独立输入数

退化不等于统计量恒为零。它仅表示平均偏移不能由单个坐标解释,剩余的二阶相互作用可能仍显著,而且具有另一种尺度与分布。

例子与边界

样本方差正是一个二阶U统计量 ​

设 EX=μ、Var(X)=σ2,取 h(x,y)=(x−y)2/2。独立性使 Eh(X1,X2)=σ2。代数恒等式

∑i<j(xi−xj)2=n∑i(xi−x¯)2

可由展开左右两边并使用 ∑i<jxixj=((∑ixi)2−∑ixi2)/2 证明。因此 Un 恰为分母 n−1 的样本方差。对数据 (0,1,3),三个核值为 (1/2,9/2,2),平均 7/3;直接计算围绕均值 4/3 的平方差除以2,也得到 7/3。

若再有四阶中心矩 μ4=E(X−μ)4<∞,令 a=x−μ,b=y−μ,可算出

h1(x)=(x−μ)2−σ22,h2(x,y)=−(x−μ)(y−μ).

故 ζ1=(μ4−σ4)/4、ζ2=σ4,样本方差的精确方差为

Var(Un)=μ4−σ4n+2σ4n(n−1).

以标准正态为例,σ2=1,μ4=3,真实方差为 2/(n−1)。单个核 h(X1,X2) 的方差为2,若错误地把全部 (n2) 个核值当IID,会得到 4/[n(n−1)],少了 n/2 倍;n=10 时真实值 2/9,错误值 2/45。问题不在核行数算少了,而在忽略了共享输入。

一个完全可解的退化反例 ​

令 Xi 独立地以等概率取 −1,+1,核 h(x,y)=xy。目标 θ=0,且 E[h(x,X2)]=xEX2=0,所以 h1=0,h2=h。于是

Un=(∑iXi)2−nn(n−1),Var(Un)=2n(n−1).

方差是 n−2 阶,但极限不是正态。由IID CLT及连续映射定理,

nUn=nn−1[(∑iXin)2−1]⇒Z2−1,Z∼N(0,1).

这条极限下界为 −1,明显不对称。以四条输入 (−1,−1,1,1) 为例,六个核值之和为 −2,U4=−1/3;退化核仍可给出负估计值;其 ζ1=0,因而不满足上节非退化正态结论的条件。

有限二阶观测矩不等于有限二阶核矩 ​

样本方差核需要检查 Eh2,它涉及观测的四阶矩。若观测只有有限方差、四阶矩无穷,样本方差仍可无偏并一致,但本页的有限方差公式和普通根号样本量CLT不再由上述证明支持。应检查统计量核的矩条件,不能只看原始 X 的方差是否有限。

推论与应用

用行均值估计投影,而不是把核行当样本 ​

定义每个观测连接的核平均

ri=1n−1∑j≠ih(Xi,Xj),h^1i=ri−Un,ζ^1=1n∑ih^1i2.

注意 n−1∑iri=Un,故这些估计投影的样本均值恰为零。条件于 Xi,组成 ri 的其他输入独立,因此

E[1n∑i{ri−θ−h1(Xi)}2]=EVar(h(X1,X2)∣X1)n−1→0.

精确方差式使 Un→Pθ,上式控制投影的经验平方误差,再以Cauchy–Schwarz不等式和 h1(Xi)2 的大数律即可推出 ζ^1→Pζ1。因此非退化时可用 2ζ^1/n 作渐近标准误;它不是有限样本无偏标准差,在退化情形也没有正确校准的保证。

计算接口与适用范围 ​

输入为 n 个独立观测、对称核和目标核期望的解释。逐个访问 i<j,核值同时加进总和与两个端点的行和;完成后总计恰有 n(n−1)/2 个无序对,每个行和恰含 n−1 项。这是实现的不变量,能检查漏对、重复计数和分母错误。

一般核需 O(n2) 次求值;除保存输入外,若需要投影标准误,存 n 个行和,额外存储 O(n),不必保存整个核矩阵。仅求均值时总和本身为 O(1) 额外累加状态。样本方差利用上面的恒等式可降为 O(n),说明核形式不等于必须使用二重循环。若预算不足而只取部分对,就得到另一个估计规则,其额外抽对误差需单独分析。

MMD的无偏两样本估计同样出现共享输入与退化结构。但两组大小可不同、跨组项含全部 mn 对,一般不能直接当成本页的一样本二阶核平均。该页保留两样本公式和检验校准;本页提供理解投影与独立单元的基础,而非替换它的全部渐近定理。

两个自测:若核是 h(x,y)=(x+y)/2,则 h1(x)=(x−EX)/2、h2=0,Un恰等于样本均值,方差为 Var(X)/n。若只列出四个观测的六对,就宣称有六个独立观测,错误在独立单位:原始独立随机对象仍只有四个,核行的依赖必须进入方差。

本页在平方可积条件下的投影、方差与非退化极限结论,是固定阶Hoeffding分解在 m=2 时的特例;开头仅需一阶可积的定义与无偏性保留其较宽条件。系数 2 和余项系数 1 来自一般组合重数。一般页另证明按任意子集容斥净化的canonical核、各阶正交方差,并计算三阶Rademacher乘积核的 n3/2 尺度与 Z3−3Z 极限;本页的二阶证明和实例均仍独立可读。

若因核昂贵而只随机取部分对,见不完全U统计量。条件于原始资料,均匀有放回抽 B 对的计算方差为核表方差除以 B;解除条件后还必须加上完整U的资料方差。尤其本页的退化乘积核原方差为 n−2 阶,线性 B 会把计算误差带回 n−1 阶,不能照搬非退化问题的预算。

参考资料
关系图谱18 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系