Skip to content

定理Theorem

对称和的自归一化界

Self-normalized symmetric sum · 对称均值的自归一化区间

条件于独立对称观测的幅度证明自归一化尾界,反演不需已知方差的中心区间,并明确对称性、小样本与持续查看的边界。

形式陈述 ​

能否在没有已知方差上界时,让观测自己提供归一化尺度?有时可以,但需要另一份结构。本页用相互独立且围绕同一中心对称代替已知范围或方差预算;它不是任意有限方差分布都适用的学生化规则。

设 D1,…,Dn 为几乎处处有限的实随机变量,n≥1。要求它们相互独立,且每一项的分布关于零对称,即 Di=d−Di。不要求同分布,也不要求任何矩存在。记

S=∑i=1nDi,Q=∑i=1nDi2,T={S/Q,Q>0,0,Q=0.

对每个 x>0,有

(1)Pr(|T|≥x)≤2e−x2/2.

因此,预先固定 0<δ<1,令 c=2log⁡(2/δ),就有

(2)Pr(|S|>cQ)≤δ.

在 Q=0 时 S=0,式(2)的严格越界事件不会发生。不要把它改成包含 0≥0 的非严格事件,否则退化样本会被错误地判成越界。

反演共同中心 ​

现在观察 X1,…,Xn,各项独立且关于同一个未知的 μ 对称。将 Di=Xi−μ 代入式(2),并按检验反演保留满足

(3)n2(X¯−m)2≤c2∑i(Xi−m)2

的候选中心 m。令 A=∑i(Xi−X¯)2,则

∑i(Xi−m)2=A+n(X¯−m)2.

当 n>c2 时,式(3)恰好给出闭区间

(4)Cn=[X¯−rn,X¯+rn],rn=cAn(n−c2).

它以至少 1−δ 的概率覆盖共同对称中心。若各项可积,对称性使它们的均值都等于 μ,此时它也是均值区间。若均值不存在,只能称为中心区间。

当 n≤c2 时,式(3)对所有 m∈R 成立,所以本构造返回整个实数轴。此时不能继续使用式(4),也不能把负的根号内部截成零。

直觉

一条很大的读数不仅抬高分子 S,也增大分母 Q。不过“两边一起变大”本身不构成定理。关键是:给定每条观测有多大之后,其正负号仍是公平、独立的随机选择。

先固定幅度,再优化指数参数 ​

取与全部幅度 Ai=|Di| 独立的公平随机符号 εi∈{−1,1}。独立性和逐项对称性保证

(D1,…,Dn)=d(ε1A1,…,εnAn).

原变量在零点可以有原子;给零任意公平符号不改变其值。条件于全部 Ai 后,若 Q>0,记 ai=Ai/Q,便有 ∑iai2=1。利用公平符号的指数矩界 cosh⁡u≤eu2/2,对每个确定的 λ∈R,

E[eλT∣A1,…,An]=∏icosh⁡(λai)≤exp⁡(λ22∑iai2)=eλ2/2.

在 Q=0 时左侧为1,同一上界成立。再对幅度取期望,得到 EeλT≤eλ2/2。用指数 Markov 方法,对 λ>0,

Pr(T≥x)≤e−λx+λ2/2.

取 λ=x,并对 −T 重复,证明式(1)。被归一化的量具有尺度1的指数矩,并不表示原始 Di 有任何指数矩。

这里的顺序不能省略。仅有 EeλS−λ2Q/2≤1 对每个固定 λ 成立,并不允许看见 Q 后直接把 λ 换成 x/Q。本证明先借独立对称性条件于全部幅度,才取得归一化变量本身的指数矩。

与学生化记号的关系 ​

若 n≥2 且 A>0,令 s2=A/(n−1)。式(4)等价于保留

|n(X¯−m)s|≤cn−1n−c2.

左侧形似 Student 统计量,但本页没有证明它服从 tn−1 分布,阈值也不是 t 分位数。正态模型的精确 $t$ 枢轴依赖额外分布结构;对称分布下本页给的是较保守的非渐近上界。

例子与边界

十条读数,不输入方差 ​

固定 n=10,δ=0.05,观察

8,9,9,10,10,10,10,11,11,12.

先算 X¯=10,再算 A=4+1+1+0+0+0+0+1+1+4=12。由于

c2=2log⁡40≈7.37775891<10,

式(4)给

r10=12(2log⁡40)10(10−2log⁡40)≈1.837454,

所以区间约为 [8.162546,11.837454]。计算没有输入总体方差,但使用区间前仍须有关于共同中心对称、各次独立的模型依据。样本看起来左右整齐不是检验并确认总体对称性的证据。

把记录换成 Yi=20+3Xi,新均值为50,离均平方和为108,区间为 50±3r10。固定置信度下 c 不变;平移缩放使中心与误差同时换单位。

零样本方差:为什么这次可以是单点 ​

当 n>c2 且所有观测等于同一个 x,式(4)确实返回 {x}。这不矛盾:对称性已经限制了在远离真实中心的某一点堆积质量的能力。若总体只以相同概率取 μ−a,μ+a,全部十次相同的概率是 2/210=1/512;这两种样本都会漏掉中心,但其概率低于5%。其余失覆盖可能性由完整的尾界控制,而不是由这个单一例子穷尽。

经验 Bernstein处理已知范围的任意 IID 分布,不要求对称;它在零样本方差时仍须保留范围校准项。两种方法的条件不同,不能只比较相同数据上的半径后择优而仍给每种完整的错误预算。

删除对称性就会真的失败 ​

若 Xi∼Bernoulli(0.01) 独立,n=100,总体均值为0.01。全零样本概率为

(0.99)100≈0.366032.

在此事件上 A=0,错误使用本页区间会输出 {0},失覆盖至少36.6%。这些变量有限方差且有界,但并不关于均值对称。失效的是分布假设,而不是样本数不足。

若各项都复制同一个公平符号 R,每项仍对称,却有 T=nR。在 n=10,δ=0.05 时 n>c,越界概率为1。失效的是相互独立,不能用“各项边缘对称”补上。

中心、时间与自归一化的不同含义 ​

独立 Cauchy 观测有对称中心,所以上述中心覆盖仍成立,但其通常期望不存在。它也不承诺区间宽度按 n−1/2 收缩:当平方和由极端值主导时,半径可能很大。

式(4)是预先固定 n 的保证。无限重复查看并在最有利时刻停止需要另一条路径级论证;条件对称但依赖的序列也不能直接复用上述全幅度条件化。混合序贯边界的条件对称支路为固定指数参数构造上鞅后再混合,保留的是另一种全时间边界。

“自归一化”并不只有一个对象。自归一化重要性采样除以权重和,目标是修正抽样测度;线性赌博机使用设计矩阵范数和条件次高斯噪声。本页除以残差平方和,依据是独立对称性,三者的分母与假设不能互换。

推论与应用

若分布未知但合理的测量模型提供对称噪声,可以先报告式(4)的中心区间,并单独说明均值是否存在;不必先宣称测量值有已知硬范围。若只有有限方差而没有对称性,应回到MoM或Catoni 均值估计,同时承担它们的方差尺度责任。

由Cauchy–Schwarz,|S|≤nQ 恒成立,故 |T|≤n。这从另一个角度解释为什么 c≥n 时反演得不到有限端点。

自测与答案 ​

  1. 对上述十点样本,把失败概率改为 δ=0.001。能否给有限的式(4)区间?若再把每条观测复制十遍,是否就补足样本量?
  2. 独立 Di 分别等概率取 ±1,±2,±3。条件幅度固定,求 Q、T 的最大绝对值,列出 Pr(|T|≥1) 并与式(1)比较。

答案:第一题 c2=2log⁡2000≈15.2018>10,本构造只能给整个实轴;复制没有创造独立观测。第二题 Q=14,|T| 最大为 6/14。八种符号和依次属于 {−6,−4,−2,0,0,2,4,6},其中四种绝对值不小于 14,所以概率为 1/2;式(1)给 2e−1/2>1,截成1后仍有效但很松。上界有效不等于每个阈值都提供非平凡信息。

参考资料
关系图谱11 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系