形式陈述
“有效样本量”不是单一数据属性,而是把某个 Monte Carlo 估计量的方差 公理库 方差 Variance 随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。 与理想 IID 等权基准匹配后的折算。两种常见定义对应不同机制,不能互换。
对重要性采样 公理库 重要性采样 Importance sampling · 重要抽样 从易采样的提议分布取样,以目标和提议的密度比修正访问频率并估计目标积分。 的非负权重 W 1 , … , W N ,先要求 ∑ j W j > 0 ,再令 W ~ i = W i / ∑ j W j 。常用权重 ESS 为
ESS ^ w = 1 ∑ i = 1 N W ~ i 2 = ( ∑ i W i ) 2 ∑ i W i 2 , 其范围为 [ 1 , N ] :等权时为 N ,单一权重占满时趋近 1 。若 W i IID、0 < E W < ∞ 且 E W 2 < ∞ ,总体近似写成
ESS w ≈ N 1 + CV 2 ( W ) . 它只利用权重,忽略被积函数 f ;严格的函数特定方差还涉及 W ( f − I ) ,所以这是退化诊断而非普适误差定理。
对平稳MCMC 公理库 Markov 链 Monte Carlo Markov chain Monte Carlo · MCMC 构造以目标分布为不变分布的 Markov 转移,并用一条遍历轨道的时间平均估计目标期望。 轨道 Y t = f ( X t ) ,假设 0 < σ f 2 = Var π ( Y t ) < ∞ ,自相关 ρ k = Cov ( Y t , Y t + k ) / σ f 2 。先展开样本均值方差,可得到有限 N 的精确等式
Var ( Y ¯ N ) = σ f 2 N [ 1 + 2 ∑ k = 1 N − 1 ( 1 − k N ) ρ k ] . 系数 N − k 来自相隔 k 期的观测对数量。长轨道近似把有限加权和替换为无限和;若协方差级数绝对可和,且相应极限 τ f 严格为正,则
Var ( Y ¯ N ) ≈ σ f 2 N τ f , τ f = 1 + 2 ∑ k = 1 ∞ ρ k , 并定义
ESS f = N τ f . 这里使用的是协方差 公理库 协方差 Covariance 两个随机变量中心化乘积的期望,衡量线性共同变化。 长程和。ESS 随 f 改变;后验均值、尾部指示函数和量化分位数没有一个共同的“链 ESS”。有限轨道必须估计并截断自相关和,常用初始正序列、谱方差或批均值方法;任意把噪声较大的远期样本相关全加起来会得到不稳定甚至负方差估计。
直觉
权重 ESS 问的是:如果总质量几乎由少数点承担,这批加权点像多少个等权点?MCMC ESS 问的是:若相邻观测重复同一方向的波动,样本均值的方差相当于多少个独立目标样本?一个看横截面的质量集中,一个看时间方向的相关传播。
“等效”只相对于选定估计量和方差基准。ESS 为 100 不表示真的有 100 个独立点,也不保证罕见模态被看见。它把已观察到的波动压成易比较尺度,不能给未观察区域补信息。
例子与边界
对权重 ( 1 , 3 , 6 ) ,归一化后为 ( 0.1 , 0.3 , 0.6 ) ,所以
ESS ^ w = 1 0.1 2 + 0.3 2 + 0.6 2 = 1 0.46 ≈ 2.17 . 虽然有三个粒子,最大权重点使其质量均匀性只相当于约 2.17 个等权点。重采样三个后代不会把 ESS 的信息凭空变成三:它只把权重重置,同时以祖先重复换来额外抽样噪声。
对平稳二状态链,令每步以 0.9 概率留在当前状态,以 0.1 切换,并令 f 在两状态取 − 1 , + 1 。其 ρ k = 0.8 k ,故
τ f = 1 + 2 0.8 1 − 0.8 = 9 , ESS f = N / 9. 若反过来每步以 0.9 概率切换,则 ρ k = ( − 0.8 ) k ,τ f = 1 / 9 ,理论 ESS 为 9 N 。负相关能让均值比 IID 更稳定,所以 MCMC ESS 可以超过名义样本数;把软件结果强行截到 N 会丢掉这层方差信息。
这里的 9 N 是长轨道尺度,不能当作任意 N 的精确值。例如只有两个样本时,负相关链满足 Var ( Y ¯ 2 ) = ( 1 − 0.8 ) / 2 = 0.1 ;与单点方差为 1 的 IID 均值比较,精确方差等效样本数为 10 ,而非 18 。这个差异来自有限和中的边界权重,说明短轨道不能直接套无限和近似。
常数函数 f 的边缘方差为零,自相关分母无定义,此时该期望已经无需 Monte Carlo 估计;长期方差为零而单点方差非零的退化情形也不适用通常的正态标准误解释。协方差和收敛本身只给二阶尺度,正态误差条还需要适用的链中心极限定理。
边界首先是无限二阶矩。若重要性权重有有限均值但无限方差,有限样本的权重可能暂时很均匀,ESS ^ w 很高,下一次尾部巨权重却能彻底改写估计。总体 CV 形式此时没有定义。MCMC 中,未收敛或困在单一模态的链也可能在峰内表现出短自相关,给出虚高 ESS;估计器只能描述已走到的稳态样结构,不能检验全局遍历性。
推论与应用
SMC 用权重 ESS 触发重采样,MCMC 用函数 ESS 把 Monte Carlo 标准误写成 σ ^ f / ESS f 。这两条应用都必须先满足相应方差存在与近似稳定条件。阈值如 N / 2 是成本—退化折中,不是概率定理;不同重采样成本和目标序列可取不同阈值。
实际报告应按主要 estimand 给 bulk、tail 或指示函数 ESS,并同时给链间一致性与轨迹诊断。权重场景还应报告最大权重、Pareto 尾形或重复提议结果。ESS 最适合比较同一任务下的采样效率;跨不同目标函数、不同计算成本或不同偏差算法直接排行,会把不可比的方差基准混在一起。
参考资料
A. B. Kong, J. S. Liu, and W. H. Wong, “Sequential Imputations and Bayesian Missing Data Problems,” Journal of the American Statistical Association 89(425), 1994, pp. 278–288.
Charles J. Geyer, “Practical Markov Chain Monte Carlo,” Statistical Science 7(4), 1992, pp. 473–483.
Jun S. Liu, Monte Carlo Strategies in Scientific Computing , Springer, 2001, §§2.5 and 12.3.
Aki Vehtari et al., “Rank-Normalization, Folding, and Localization: An Improved R ^ for Assessing Convergence of MCMC,” Bayesian Analysis 16(2), 2021, pp. 667–718.