形式陈述
用样本平均估计总体期望 理路 期望 Expectation · Expected value 实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。 时,每条记录获得相同权重。若要检验另一个均值θ ,可以问:必须把这些权重改动多少,才能让加权平均变成θ ?经验似然保留已观察到的位置,允许它们的概率质量变化,再用似然 理路 似然函数 Likelihood function 固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。 衡量这份改变。它不用预先指定正态、Gamma或其他完整总体分布。
有限样本定义与支持边界
给定实数x 1 , … , x n ,n ≥ 1 ,定义
(1) R n ( θ ) = max { ∏ i = 1 n ( n p i ) : p i ≥ 0 , ∑ i p i = 1 , ∑ i p i ( x i − θ ) = 0 } . 空可行集的最大值约定为0,ℓ n ( θ ) = − 2 log R n ( θ ) ,其中− log 0 = + ∞ 。由算术—几何平均不等式,0 ≤ R n ≤ 1 ,等权p i = 1 / n 在θ = x ¯ 达到1。
这里的p i 附着于记录,允许记录取相同值。若某个值出现m 次,固定分给这组的总质量后,乘积在组内等分时最大。这恰好产生该支持点质量的m 次幂,所以记录权重的写法与按不同取值分组的似然比相容;并列不必加微小扰动。
约束可以写成θ = ∑ i p i x i 。于是可行集非空当且仅当θ ∈ [ x min , x max ] 。样本不恒定时,R n > 0 恰在该区间内部:端点只能把质量放在达到端点的记录上,其他记录权重必为零,故乘积为零。若所有x i = a ,则R n ( a ) = 1 、其他地方为0。空表不在定义中。
一个唯一的标量乘子
在非恒定样本且x min < θ < x max 时,写z i = x i − θ ,其中z m i n < 0 < z m a x 。在开区间
I θ = ( − 1 / z max , − 1 / z min ) 上所有1 + λ z i 均为正。考虑
(2) H ( λ ) = 1 n ∑ i z i 1 + λ z i . 它的导数为− n − 1 ∑ i z i 2 / ( 1 + λ z i ) 2 < 0 。靠近左端,最大正z i 的项趋正无穷;靠近右端,最小负z i 的项趋负无穷。因此存在唯一根λ ^ ∈ I θ 。置
(3) p i ∗ = 1 n ( 1 + λ ^ z i ) , ℓ n ( θ ) = 2 ∑ i log ( 1 + λ ^ z i ) . 根方程给∑ p i ∗ z i = 0 ,而∑ ( 1 + λ ^ z i ) − 1 = n − λ ^ ∑ z i / ( 1 + λ ^ z i ) = n 给归一化。故这是一组合法正权重。
为什么它是全局最优,而非仅仅驻点?对任何另一组正可行权重p ,利用对数的凹性,
∑ i ( log p i − log p i ∗ ) ≤ ∑ i p i − p i ∗ p i ∗ = n ∑ i ( p i − p i ∗ ) + n λ ^ ∑ i z i ( p i − p i ∗ ) = 0. 严格凹性使等号只在p = p ∗ 成立;有零权重的候选乘积为0。式(3)因此给出唯一最大化权重和真正似然比。
有限正方差下的卡方极限
设X i 独立同分布,E X i = θ 0 且0 < σ 2 = Var X i < ∞ 。则
(4) ℓ n ( θ 0 ) ⇒ χ 1 2 . 式(4)表示按分布收敛 理路 依分布收敛 Convergence in distribution · Weak convergence 分布函数在极限分布连续点处收敛的随机变量收敛概念。 趋向自由度为1的卡方分布 理路 卡方分布 Chi-square distribution · Chi-squared distribution · χ² distribution 若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。 。
下面证明只用二阶矩。令Z i = X i − θ 0 ,m n = max i ≤ n | Z i | ,s n 2 = n − 1 ∑ i Z i 2 。首先,由并集界,任意ε > 0 都有
P ( m n > ε n ) ≤ n P ( | Z | > ε n ) ≤ ε − 2 E [ Z 2 1 { | Z | > ε n } ] ⟶ 0. 所以m n = o P ( n ) 。大数律 理路 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 给s n 2 → P σ 2 ,中心极限定理 理路 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 给Z ¯ = O P ( n − 1 / 2 ) 。非退化零均值总体在零两侧都有正概率,故样本同时出现正负值的概率趋于一;以下在这个事件上使用唯一根。
根方程可改写为
(5) Z ¯ = λ ^ 1 n ∑ i Z i 2 1 + λ ^ Z i . 分母为正,故λ ^ 与Z ¯ 同号;右边平均至少s n 2 / ( 1 + | λ ^ | m n ) 。于是
| λ ^ | { s n 2 − | Z ¯ | m n } ≤ | Z ¯ | . 花括号趋于σ 2 > 0 ,从而λ ^ = O P ( n − 1 / 2 ) ,且max i | λ ^ Z i | = o P ( 1 ) 。这一步先界定乘子,再展开对数,避免循环使用待证速率。
令a n = max i | λ ^ Z i | 。当a n < 1 时,式(5)中的平均与s n 2 之差绝对值至多a n s n 2 / ( 1 − a n ) ,因此
λ ^ = Z ¯ s n 2 + o P ( n − 1 / 2 ) . 在| v | ≤ 1 / 2 上,| log ( 1 + v ) − v + v 2 / 2 | ≤ C | v | 3 ,可取固定常数C 。式(3)的总余项绝对值不超过2 C a n n λ ^ 2 s n 2 = o P ( 1 ) ,故
ℓ n ( θ 0 ) = 2 n λ ^ Z ¯ − n λ ^ 2 s n 2 + o P ( 1 ) = n Z ¯ 2 s n 2 + o P ( 1 ) ⇒ χ 1 2 . 这里用最大项乘平方和控制三次余项,没有要求E | X | 3 < ∞ 。样本未跨过真均值的例外事件概率趋零,不影响极限,但在有限样本中它可能很重要。
例子与边界
三条记录的完整权重
取x = ( − 1 , 0 , 2 ) ,检验θ = 0 。根方程是
− 1 1 − λ + 2 1 + 2 λ = 0 , 解得λ ^ = 1 / 4 ,三个权重为( 4 / 9 , 1 / 3 , 2 / 9 ) 。它们加起来为1,加权均值为− 4 / 9 + 4 / 9 = 0 。于是
R 3 ( 0 ) = ( 4 / 3 ) ⋅ 1 ⋅ ( 2 / 3 ) = 8 / 9 , ℓ 3 ( 0 ) = 2 log ( 9 / 8 ) . 等权均值是1 / 3 ;为了移到0,负观测得到更多质量。候选θ = − 1 虽属于闭凸包,却只能把质量全部放在第一条,故R 3 ( − 1 ) = 0 。闭凸包可行与正似然值是两个不同问题。
95%渐近校准在四次投币中只有7/8覆盖
令n = 4 ,X i 为独立公平Bernoulli,真均值为1 / 2 。若成功数k 满足0 < k < 4 ,组内等分得到
R 4 ( θ ) = ( θ k / 4 ) k ( 1 − θ 1 − k / 4 ) 4 − k , 0 < θ < 1. 在θ = 1 / 2 ,k = 2 时ℓ = 0 ,k = 1 或3时R = 16 / 27 、ℓ = 2 log ( 27 / 16 ) ≈ 1.0465 ,均小于χ 1 2 的95%分位数约3.8415。但k = 0 或4时,经验支持只有一个点,R 4 ( 1 / 2 ) = 0 ,必然拒绝。实际覆盖为
P ( 1 ≤ k ≤ 3 ) = 1 − 2 ( 1 / 2 ) 4 = 7 / 8. 混合表的公式恰与二项参数似然比相同,并不意味着两种方法在所有表上相同:全零表的二项模型仍允许成功概率1 / 2 ,其参数似然比为1 / 16 ;经验似然只允许在实际出现的0上放质量,目标则不可行。
定理没有包含的情形
零总体方差时,统计量在真值处恒为0,不能用非退化的χ 1 2 解释。无限方差时,上面的最大项、二阶平均和中心极限定理链条不再成立。依赖资料也不能直接套IID结论;把估计得到的其他参数放进约束后,约束值彼此相关,通常还需另外展开。多维均值、一般估计方程和修正经验似然都有独立条件,本页不因名称相近而同时承诺。
推论与应用
可执行的求根与误差报告
先检查n ≥ 1 、样本是否恒定、候选是否在开凸包。内部候选若H ( 0 ) = x ¯ − θ = 0 ,直接返回均匀权重。若H ( 0 ) > 0 ,根在0与右极点之间;从0向右极点逐次将剩余距离减半,直至找到H < 0 的内部点。右端极限为负无穷,保证这一步有限终止。H ( 0 ) < 0 时对左侧对称操作。
有两个严格异号内部端点后,用二分法 理路 二分求根法 Bisection method 以端点异号区间为不变量,给出可验证误差界、对数成本和有限精度停止条件。 保持根的括界;不能在极点处代入。每次评估需O ( n ) 算术,初始括界宽B 、目标宽度ε > 0 时,二分至多max { 0 , ⌈ log 2 ( B / ε ) ⌉ } 次。靠近支持边界时,取得初始异号括界和高精度函数符号的成本须另计;若数值误差遮住符号,应提高精度或报告未判定,而非硬选方向。
从乘子括界计算每个正分母、权重与对数范围,报告归一化残差、均值残差以及ℓ 的数值误差。很小的R 应用对数表示,不能把浮点下溢的0混同于数学上的不可行。
置信集合的形状与概率层次
对固定c ≥ 0 ,集合{ θ : ℓ n ( θ ) ≤ c } 是区间或单点。理由是可行权重集合具有线性均值映射,而∑ log ( n p i ) 为凹函数:把分别对应θ 1 , θ 2 的权重混合,得到对应混合均值的权重,且对数似然至少是原两者的加权平均。这调用凸性与凹性 理路 凸函数 Convex function 函数在任意凸组合处不超过相同权重下函数值的凸组合。 的基本不等式,证明剖面对数似然凹、ℓ 凸。
若c 取χ 1 2 的1 − α 分位数,式(4)给出在每个固定有限正方差总体下覆盖趋于1 − α 。这是对新样本的渐近抽样保证,不是“给定眼前资料,真均值在区间内的概率”,也不是任意n 的分布无关覆盖。可在矩约束与反演的迁移验收 完整枚举支持坍缩的小表,而不是只画一条平滑似然曲线。