形式陈述
能否在没有已知方差上界时,让观测自己提供归一化尺度?有时可以,但需要另一份结构。本页用相互独立且围绕同一中心对称 代替已知范围或方差预算;它不是任意有限方差分布都适用的学生化规则。
设 D 1 , … , D n 为几乎处处有限的实随机变量,n ≥ 1 。要求它们相互独立 理路 独立性 Statistical independence 从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。 ,且每一项的分布 理路 概率分布 Probability distribution · Law 可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。 关于零对称,即 D i = d − D i 。不要求同分布,也不要求任何矩存在。记
S = ∑ i = 1 n D i , Q = ∑ i = 1 n D i 2 , T = { S / Q , Q > 0 , 0 , Q = 0. 对每个 x > 0 ,有
(1) Pr ( | T | ≥ x ) ≤ 2 e − x 2 / 2 . 因此,预先固定 0 < δ < 1 ,令 c = 2 log ( 2 / δ ) ,就有
(2) Pr ( | S | > c Q ) ≤ δ . 在 Q = 0 时 S = 0 ,式(2)的严格越界事件不会发生。不要把它改成包含 0 ≥ 0 的非严格事件,否则退化样本会被错误地判成越界。
反演共同中心
现在观察 X 1 , … , X n ,各项独立且关于同一个未知的 μ 对称。将 D i = X i − μ 代入式(2),并按检验反演 理路 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 保留满足
(3) n 2 ( X ¯ − m ) 2 ≤ c 2 ∑ i ( X i − m ) 2 的候选中心 m 。令 A = ∑ i ( X i − X ¯ ) 2 ,则
∑ i ( X i − m ) 2 = A + n ( X ¯ − m ) 2 . 当 n > c 2 时,式(3)恰好给出闭区间
(4) C n = [ X ¯ − r n , X ¯ + r n ] , r n = c A n ( n − c 2 ) . 它以至少 1 − δ 的概率覆盖共同对称中心。若各项可积,对称性使它们的均值都等于 μ ,此时它也是均值区间。若均值不存在,只能称为中心区间。
当 n ≤ c 2 时,式(3)对所有 m ∈ R 成立,所以本构造返回整个实数轴。此时不能继续使用式(4),也不能把负的根号内部截成零。
直觉
一条很大的读数不仅抬高分子 S ,也增大分母 Q 。不过“两边一起变大”本身不构成定理。关键是:给定每条观测有多大之后,其正负号仍是公平、独立的随机选择。
先固定幅度,再优化指数参数
取与全部幅度 A i = | D i | 独立的公平随机符号 ε i ∈ { − 1 , 1 } 。独立性和逐项对称性保证
( D 1 , … , D n ) = d ( ε 1 A 1 , … , ε n A n ) . 原变量在零点可以有原子;给零任意公平符号不改变其值。条件于全部 A i 后,若 Q > 0 ,记 a i = A i / Q ,便有 ∑ i a i 2 = 1 。利用公平符号的指数矩界 理路 次高斯随机变量 Sub-Gaussian random variable · 次高斯尺度 · Subgaussian variance proxy 用全实数上的中心化指数矩上界定义次高斯尺度,计算独立加权平均的尾界,并区分方差、尺度代理与条件次高斯假设。 cosh u ≤ e u 2 / 2 ,对每个确定的 λ ∈ R ,
E [ e λ T ∣ A 1 , … , A n ] = ∏ i cosh ( λ a i ) ≤ exp ( λ 2 2 ∑ i a i 2 ) = e λ 2 / 2 . 在 Q = 0 时左侧为1,同一上界成立。再对幅度取期望,得到 E e λ T ≤ e λ 2 / 2 。用指数 Markov 方法 理路 Chernoff 方法与 Chernoff 界 Chernoff method · Chernoff bounds 从指数矩与 Markov 不等式推导尾界,给出独立 Bernoulli 和的乘法形式、KL 形式及适用条件。 ,对 λ > 0 ,
Pr ( T ≥ x ) ≤ e − λ x + λ 2 / 2 . 取 λ = x ,并对 − T 重复,证明式(1)。被归一化的量具有尺度1的指数矩,并不表示原始 D i 有任何指数矩。
这里的顺序不能省略。仅有 E e λ S − λ 2 Q / 2 ≤ 1 对每个固定 λ 成立,并不允许看见 Q 后直接把 λ 换成 x / Q 。本证明先借独立对称性条件于全部幅度,才取得归一化变量本身的指数矩。
与学生化记号的关系
若 n ≥ 2 且 A > 0 ,令 s 2 = A / ( n − 1 ) 。式(4)等价于保留
| n ( X ¯ − m ) s | ≤ c n − 1 n − c 2 . 左侧形似 Student 统计量,但本页没有证明它服从 t n − 1 分布,阈值也不是 t 分位数。正态模型的精确 $t$ 枢轴 理路 Student t 分布 Student's t-distribution · t distribution 由独立正态分子与卡方随机尺度定义 t 分布,解释自由度、重尾机制及正态样本均值的精确推断。 依赖额外分布结构;对称分布下本页给的是较保守的非渐近上界。
例子与边界
十条读数,不输入方差
固定 n = 10 , δ = 0.05 ,观察
8 , 9 , 9 , 10 , 10 , 10 , 10 , 11 , 11 , 12. 先算 X ¯ = 10 ,再算 A = 4 + 1 + 1 + 0 + 0 + 0 + 0 + 1 + 1 + 4 = 12 。由于
c 2 = 2 log 40 ≈ 7.37775891 < 10 , 式(4)给
r 10 = 12 ( 2 log 40 ) 10 ( 10 − 2 log 40 ) ≈ 1.837454 , 所以区间约为 [ 8.162546 , 11.837454 ] 。计算没有输入总体方差,但使用区间前仍须有关于共同中心对称、各次独立的模型依据。样本看起来左右整齐不是检验并确认总体对称性的证据。
把记录换成 Y i = 20 + 3 X i ,新均值为50,离均平方和为108,区间为 50 ± 3 r 10 。固定置信度下 c 不变;平移缩放使中心与误差同时换单位。
零样本方差:为什么这次可以是单点
当 n > c 2 且所有观测等于同一个 x ,式(4)确实返回 { x } 。这不矛盾:对称性已经限制了在远离真实中心的某一点堆积质量的能力。若总体只以相同概率取 μ − a , μ + a ,全部十次相同的概率是 2 / 2 10 = 1 / 512 ;这两种样本都会漏掉中心,但其概率低于5%。其余失覆盖可能性由完整的尾界控制,而不是由这个单一例子穷尽。
经验 Bernstein 理路 经验 Bernstein 均值界 Empirical Bernstein mean bound · 经验方差均值界 对已知有界范围的 IID 观测,以经过校准的样本方差构造固定样本均值区间,解释标准差估计误差、零样本方差与重复查看的边界。 处理已知范围的任意 IID 分布,不要求对称;它在零样本方差时仍须保留范围校准项。两种方法的条件不同,不能只比较相同数据上的半径后择优而仍给每种完整的错误预算。
删除对称性就会真的失败
若 X i ∼ Bernoulli ( 0.01 ) 独立,n = 100 ,总体均值为0.01。全零样本概率为
( 0.99 ) 100 ≈ 0.366032 . 在此事件上 A = 0 ,错误使用本页区间会输出 { 0 } ,失覆盖至少36.6%。这些变量有限方差且有界,但并不关于均值对称。失效的是分布假设,而不是样本数不足。
若各项都复制同一个公平符号 R ,每项仍对称,却有 T = n R 。在 n = 10 , δ = 0.05 时 n > c ,越界概率为1。失效的是相互独立,不能用“各项边缘对称”补上。
中心、时间与自归一化的不同含义
独立 Cauchy 观测有对称中心,所以上述中心覆盖仍成立,但其通常期望不存在。它也不承诺区间宽度按 n − 1 / 2 收缩:当平方和由极端值主导时,半径可能很大。
式(4)是预先固定 n 的保证。无限重复查看并在最有利时刻停止需要另一条路径级论证;条件对称但依赖的序列也不能直接复用上述全幅度条件化。混合序贯边界 理路 混合序贯边界 Mixture boundary · Method of mixtures · Normal mixture boundary 对指数上鞅作预先固定的概率混合,再把财富阈值反解为对所有时间同时有效的偏差边界。 的条件对称支路为固定指数参数构造上鞅后再混合,保留的是另一种全时间边界。
“自归一化”并不只有一个对象。自归一化重要性采样 理路 自归一化重要性采样 Self-normalized importance sampling · SNIS 用未归一化目标与提议的权重和估计未知归一化常数,并以归一化权重形成目标期望的比率估计量。 除以权重和,目标是修正抽样测度;线性赌博机 理路 线性赌博机 Linear bandit · Stochastic linear bandit · 线性上下文赌博机 假设动作特征的期望奖励由未知线性参数给出,并用自归一化置信椭球设计乐观动作选择与维度相关遗憾界。 使用设计矩阵范数和条件次高斯噪声。本页除以残差平方和,依据是独立对称性,三者的分母与假设不能互换。
推论与应用
若分布未知但合理的测量模型提供对称噪声,可以先报告式(4)的中心区间,并单独说明均值是否存在;不必先宣称测量值有已知硬范围。若只有有限方差而没有对称性,应回到MoM 理路 分组均值中位数估计 Median-of-means estimator · MoM 均值估计 将独立样本分成不相交的组,先平均再取中位数,以有限方差取得依赖置信度的均值误差保证,并明确组数、余数和尺度条件。 或Catoni 均值估计 理路 Catoni 有限方差均值估计 Catoni mean estimator · Catoni 软截断均值估计 用随样本量与置信度校准的单调软截断方程估计重尾均值,证明有限方差误差界,并把括根数值容差加入最终证书。 ,同时承担它们的方差尺度责任。
由Cauchy–Schwarz 理路 Cauchy–Schwarz 不等式 Cauchy–Schwarz inequality · 柯西–施瓦茨不等式 内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。 ,| S | ≤ n Q 恒成立,故 | T | ≤ n 。这从另一个角度解释为什么 c ≥ n 时反演得不到有限端点。
自测与答案
对上述十点样本,把失败概率改为 δ = 0.001 。能否给有限的式(4)区间?若再把每条观测复制十遍,是否就补足样本量?
独立 D i 分别等概率取 ± 1 , ± 2 , ± 3 。条件幅度固定,求 Q 、T 的最大绝对值,列出 Pr ( | T | ≥ 1 ) 并与式(1)比较。
答案:第一题 c 2 = 2 log 2000 ≈ 15.2018 > 10 ,本构造只能给整个实轴;复制没有创造独立观测。第二题 Q = 14 ,| T | 最大为 6 / 14 。八种符号和依次属于 { − 6 , − 4 , − 2 , 0 , 0 , 2 , 4 , 6 } ,其中四种绝对值不小于 14 ,所以概率为 1 / 2 ;式(1)给 2 e − 1 / 2 > 1 ,截成1后仍有效但很松。上界有效不等于每个阈值都提供非平凡信息。
参考资料