形式陈述
目标是 μ = E f ( X ) ,其中 X ∼ P ,E f ( X ) 2 < ∞ 。事先把状态空间划成有限个互不重叠的层 A 1 , … , A H ,它们穷尽全部概率质量。假定各层概率 w h = P ( X ∈ A h ) > 0 已精确知道,能从每层的条件分布 理路 条件分布 Conditional distribution · Regular conditional distribution 给定观测值后随机量的概率律,以及它与原联合分布相容的核表示。 P ( ⋅ ∣ X ∈ A h ) 抽样。令
μ h = E [ f ( X ) ∣ X ∈ A h ] , σ h 2 = Var ( f ( X ) ∣ X ∈ A h ) . 在第 h 层独立产生 n h ≥ 1 个样本;各层也使用独立随机流。预算 N = ∑ h n h 固定,分层估计量为
μ ^ S = ∑ h = 1 H w h Y ¯ h , Y ¯ h = 1 n h ∑ i = 1 n h f ( X h i ) . 全期望与全方差公式 理路 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 给出 μ = ∑ h w h μ h 。层内均值无偏、层间独立,故
E μ ^ S = μ , Var ( μ ^ S ) = ∑ h w h 2 σ h 2 n h . 权重是层的真实概率 w h ,不是样本比例 n h / N ;只有比例分配时两者才相等。各层来自可反复抽样的概率分布,本式没有有限总体修正。
比例分配为何不劣于普通模拟
假定 N w h 都是正整数,取 n h = N w h 。于是分层方差为 N − 1 ∑ h w h σ h 2 。普通IID Monte Carlo 理路 Monte Carlo 积分 Monte Carlo integration · Monte Carlo quadrature 将积分改写为随机变量期望,以独立样本均值估计并用方差和概率假设量化随机误差。 单次方差可分为
Var ( f ( X ) ) = ∑ h w h σ h 2 + ∑ h w h ( μ h − μ ) 2 . 两者使用同样 N 次目标函数求值,方差之差恰为
1 N ∑ h w h ( μ h − μ ) 2 ≥ 0. 分层消去的是“这一批碰巧多抽了哪些层”的组成波动。严格改善需要各层均值不全相等;如果层均值相同,比例分配与IID基准方差相同。这项保证针对精确比例配额,随意分配或粗暴取整后需重新代入方差式检查。
分配还能进一步优化
若各层 σ h > 0 、函数求值成本相同,先把 n h 当连续数,Cauchy–Schwarz 不等式 理路 Cauchy–Schwarz 不等式 Cauchy–Schwarz inequality · 柯西–施瓦茨不等式 内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。 给出
( ∑ h w h 2 σ h 2 n h ) N ≥ ( ∑ h w h σ h ) 2 . 等号条件为 n h ∝ w h σ h ,即给概率大、波动大的层更多样本。有限预算最终需要正整数配额;若需估计层内方差,通常还要 n h ≥ 2 。零方差层若其常值已经知道,可直接加入确定贡献;仅仅猜测它方差为零不足以跳过该层。
直觉
把积分域分成若干小区域,是为了确保每一区域都有预定的观察机会。层内仍随机,层总权重却固定。因此每层内部越平坦,剩余误差越小;边界漂亮或层数多本身都不是收益保证。
图片加载失败 固定层配额与条件均值 分层抽样与Neyman分配 理路 分层抽样与 Neyman 分配 Stratified sampling · Neyman allocation 在独立层内抽样的精确方差上优化人数或费用分配,说明 Neyman 公式与实际整数约束。 也优化层内资源,但该页的随机对象是有限总体不放回设计,方差有 1 − n h / N h 修正。本页可以在同一层反复模拟新样本,没有“把该层抽完”的上界。共同的二次优化形式不能抹掉这两个实验的区别。
例子与边界
把二次积分分成左右两半
令 X ∼ Uniform ( 0 , 1 ) 、f ( x ) = x 2 ,按 A 1 = ( 0 , 1 / 2 ] 、A 2 = ( 1 / 2 , 1 ) 分层,两个概率都为 1 / 2 。边界取法不影响连续分布。由积分直接算得
μ 1 = 1 12 , μ 2 = 7 12 , E ( Y 2 ∣ A 1 ) = 1 80 , E ( Y 2 ∣ A 2 ) = 31 80 . 因此
σ 1 2 = 1 180 , σ 2 2 = 17 360 . 这两个层内方差不同:右半区的平方函数更陡,相同长度不代表相同波动。等额配给 N / 2 个样本后,
Var ( μ ^ S ) = 1 2 N ( 1 180 + 17 360 ) = 19 720 N . 原IID方差为 4 / ( 45 N ) = 64 / ( 720 N ) ,因此分层方差是原来的 19 / 64 ,约29.69%。差额 45 / ( 720 N ) = 1 / ( 16 N ) 恰好是两个层均值 1 / 12 , 7 / 12 的层间方差除以 N ,可反过来检查分解。
连续最优人数比为 2 : 17 。总预算 N = 240 时可选整数配额 ( 60 , 180 ) ,此时
Var ( μ ^ S ) = 1 4 ( 1 / 180 60 + 17 / 360 180 ) = 23 259200 . 等额 ( 120 , 120 ) 的方差为 19 / 172800 ;普通240点均值为 1 / 2700 。这只是一个可执行的近最优整数方案,不能把连续解的最优性直接盖到它头上。虽然第二层拿到四分之三样本,加权时仍用两个 1 / 2 ;若用样本比例 ( 1 / 4 , 3 / 4 ) ,期望会变成 11 / 24 ,已经偏离目标 1 / 3 。
任意配额可以浪费信息
设层标签以等概率取1或2,输出在两层都独立取 − 1 , + 1 且等概率。两层均值都为0、方差都为1,普通 N = 100 次模拟方差是 1 / 100 。比例配额 ( 50 , 50 ) 达到相同方差;若改为 ( 90 , 10 ) ,仍用正确层权重,则方差为
1 4 ( 1 90 + 1 10 ) = 1 36 > 1 100 . 估计依然无偏,但小层样本的噪声被固定的二分之一权重放大,方差变为基准的 25 / 9 倍。这个反例只改变配额,直接指出“不劣”结论所需的比例条件。
每层只有一个点时,输出行不能估出层内散布
如果每层只抽一个点,点估计仍可无偏,但没有该层内部的重复来计算 s h 2 。把不同层输出混起来算普通样本方差,会同时混入层均值差异,且忽略不同权重,通常不是目标方差估计。可在每层增加独立重复,或独立重复整套分层设计;后者每套输出一个完整估计值,再跨套估计Monte Carlo误差。不能用“层数很多”替代独立同分布条件。
推论与应用
误差估计与执行
若每层 n h ≥ 2 ,用层内样本方差 s h 2 构造
V ^ = ∑ h w h 2 s h 2 n h . 由于每个 s h 2 对 σ h 2 无偏,V ^ 无偏估计分层均值方差;V ^ 本身一般不是标准差的无偏估计。固定层数、各 n h → ∞ 且占比有正极限、总渐近方差为正时,可对各层均值联合应用独立中心极限定理 理路 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 ,得到正态区间。层数随预算增长的单点分层需要另行分析,不能套这组固定层条件。
算法输入须包含层集合、准确 w h 、每层条件采样器、整数配额和种子分流。运行时逐层维护个数、均值、平方差;不变量为第 h 层只处理来自该条件分布的样本,最后总贡献始终为 w h Y ¯ h 。函数求值总数为 N ,累加成本 O ( N ) ,额外在线统计量存储 O ( H ) ,还应计入获得条件样本的真实成本。稀有层若靠拒绝抽样获取,可能消耗远多于 n h 次底层随机提议。
用先导数据估计层方差后,应冻结配额并使用独立主样本;此时条件于先导,前述无偏性与方差表达仍成立。若层边界也由先导选择,还必须能准确计算新层概率和按新条件分布取样。同一批样本边看边决定在哪层停止时,样本数与结果相关,固定配额方差式没有自动保留。
两个自测:若每层输出已知恒为 a h ,答案是 ∑ h w h a h ,模拟方差为零;若有一层概率 w h > 0 却配额为零且层均值未知,则本页估计量没有定义,不能将其贡献默认为零。极稀有也不等于可忽略。
多层Monte Carlo 理路 多层 Monte Carlo Multilevel Monte Carlo · MLMC · 多层蒙特卡罗 · 望远镜层差模拟 用独立层间、耦合层内的望远镜差值估计精细模型,联合控制离散偏差、层差方差及整数成本,并推导三种复杂度区域。 也分配多组独立样本,但其“层”是近似精度,贡献为 P 0 与相邻耦合差 P ℓ − P ℓ − 1 ,各项权重1,合起来靠望远镜得到 E P L 。本页的层则是概率空间划分,权重为真实层概率;其总目标没有因为有限精度层级而自动产生截断偏差。两种费用分配共享平方根代数,估计对象和偏差责任不同。
参考资料