Skip to content

方法Method

非线性嵌套 Monte Carlo

Nonlinear nested Monte Carlo · Nested simulation · NMC · 内层插件偏差

分析条件均值经过非线性函数后的内层插件偏差,给出光滑与仅Lipschitz的MSE预算,并区分增加外层次数与修复内层目标。

形式陈述 ​

目标是

I=EY[g(Y,m(Y))],m(y)=E[Z∣Y=y].

假设能抽取 Y,并在固定 Y=y 后独立抽取 Z∣Y=y。产生 N 个独立外层情境 Yi,每个情境内产生 M 个条件IID输出 Zij;不同外层的完整随机对象相互独立。定义

Z¯i,M=1M∑j=1MZij,Wi,M=g(Yi,Z¯i,M),I^N,M=1N∑iWi,M.

条件期望保证内层无偏 E[Z¯i,M∣Yi]=m(Yi) 并不保证 EWi,M=I。记 IM=EW1,M、vM=Var(W1,M),只要二阶矩有限,由偏差—方差恒等式便有精确公式

E(I^N,M−I)2=vMN+(IM−I)2.

还可用全方差进一步写 vM=EVar(W1,M∣Y1)+Var(E[W1,M∣Y1]);这里第二项的条件中心是插件的条件期望,不能擅自替成 g(Y1,m(Y1))。

固定 M,外层大数律只保证 I^N,M→IM。把 N 加到无限大,可能只是更准确地计算了错误中心。外层样本标准差除以 N 估计的是围绕 IM 的波动,不包含内层偏差。

仅有Lipschitz条件的保证 ​

假设对所有有关的 y,s,t,|g(y,s)−g(y,t)|≤K|s−t|,且

A=g(Y,m(Y))∈L2,q=EVar(Z∣Y)<∞.

记 DM=g(Y,Z¯M)−A。条件独立给 E(Z¯M−m(Y))2=q/M,因而 EDM2≤K2q/M,|IM−I|2≤K2q/M。又因 Var(A+DM)≤2Var(A)+2EDM2,得到

MSE(I^N,M)≤2Var(A)N+2K2qNM+K2qM.

所以 N,M→∞ 足以给出 L2 一致性。若每个内层输出计一次费用、外层开销忽略,总成本 T=NM,令 N,M 都为 T1/2 量级,得到MSE O(T−1/2),也就是RMSE O(T−1/4);不要混淆两个指数。

二阶光滑性为什么改善偏差阶 ​

使用另一组明确条件:q<∞,每个 g(y,⋅) 二次可微,|∂t2g(y,t)|≤H,并有

K0=supM≥1E[g(Y,Z¯M)2]<∞.

最后一个条件单独保证外层方差一致有界,不可从“二次可微”推出。一个易检查的充分条件是 |g(y,t)|≤a(y)+ct2、Ea(Y)2<∞、EZ4<∞;条件Jensen给 EZ¯M4≤EZ4。另要求相关的一阶Taylor项可积,例如 E[(∂tg(Y,m(Y)))2Var(Z∣Y)]<∞ 即足够。

令 e=Z¯M−m(Y)。带积分余项的Taylor展开给

g(Y,m(Y)+e)−g(Y,m(Y))=∂tg(Y,m(Y))e+r,|r|≤H2e2.

给定 Y,线性项期望为零,故

|IM−I|≤Hq2M,MSE(I^N,M)≤K0N+H2q24M2.

取 M≍T1/3、N≍T2/3,得到MSE O(T−2/3)、RMSE O(T−1/3)。这是所述插件算法及假设下的预算界,不是所有嵌套问题的复杂度下界,也不是说每个问题都必须增加 M;线性结构或无偏重写可能更快。

直觉

先平均再弯曲,与先知道真正均值再弯曲,通常得到不同中心。若外函数凸,条件Jensen说明插件往往向上偏;外层平均会使这个偏移看起来越来越稳定,不能自行把它消掉。

增加外层不能消掉固定内层偏差

旧Monte Carlo页的线性随机效应例已经解决“同一情境的多行不独立”与外层创建费用。本页新增的是非线性改变期望中心后的偏差与光滑性预算,不能把两种模型的最优内层次数混用。

例子与边界

平方条件均值:精确MSE而非只有数量级 ​

设 Y∼N(0,1),Z∣Y=Y+ε,条件噪声独立 ε∼N(0,1)。目标 I=E[m(Y)2]=EY2=1。每个外层有 M 个独立噪声,故 Z¯M∼N(0,1+1/M)。利用正态二、四阶矩,

IM=1+1M,vM=2(1+1M)2,MSE=2(1+1/M)2N+1M2.

例如 M=16 时,无论外层增加多少,中心都停在 17/16;外层MCSE趋零也不能证明接近真实目标1。固定 T=NM=4096 次内层调用,三种整除预算为:

内层 M 外层 N 精确MSE
8 512 337/16384≈0.020569
16 256 417/32768≈0.012726
32 128 1153/65536≈0.017593

增加内层减少偏差,却减少可负担的外层情境。把 N=T/M 代回,MSE为 2(M+2+1/M)/T+M−2;连续最优点满足 M3−M=T,本例约16.0208,所以16是很合适的可实施选择。这里没有声明它是所有可变配额或所有估计器中的最优规则。

非光滑处确实可能只有 M−1 的偏差平方 ​

令 Y 为常量、Z∼N(0,1),g(t)=|t|。真实目标 |EZ|=0,但

E|Z¯M|=2πM,MSE(I^N,M)=1−2/πNM+2πM.

绝对值是1-Lipschitz,却在目标均值零处不可微;偏差平方确为 M−1,不能无条件升级为 M−2。本例外层本来没有情境波动,因而不是一般 N≍M 分配的最优性例子,只用于证明光滑性边界。

非线性不等于无法无偏化 ​

对平方目标,只要能在同一 Y 下抽两个独立条件副本 Z(1),Z(2),便有

E[Z(1)Z(2)∣Y]=m(Y)2.

因此每个外层用乘积而非单个均值的平方,可得到无偏估计;乘积二阶可积时,普通外层MC具有 O(T−1) MSE。在高斯例中,E[Z12Z22]=E(Y2+1)2=6,所以乘积方差为5。T=4096 时用2048个独立外层乘积,方差为 5/2048≈0.002441,明显小于上面的插件方案。

这不是用 Z2 替代 Z(1)Z(2);后者必须条件独立。任意 g 也未必允许有限个副本给出无偏重写。对高阶多项式可用更多条件独立副本的乘积,代价和矩条件随阶数增长;这种条件内的乘积构造与高阶U投影有关,但不能把共享外层情境的所有输出当成总体IID。

推论与应用

使用正确的误差条和冻结预算 ​

固定 M,N 后,从 N 个独立 Wi,M 计算样本方差 sW2,sW/N 只估计模拟波动。若有可信的偏差界 bM,可将近似正态区间加宽为

I^N,M±(z1−η/2sWN+bM).

这个写法明确把概率波动与偏差上界相加;它的正态覆盖仍需CLT适用,不能把 bM 当独立方差后平方相加。若没有偏差上界,必须报告“围绕插件中心的MCSE”,并通过理论、独立预算比较或可验证的无偏改写处理目标偏差。

若每个外层另花费用 a、每个内层花 b,总费用是 N(a+bM),应代回当前非线性MSE重做分配。在先导数据上估常数、冻结正式 M,N 后再跑,较容易保持本文独立单元;共享内层随机数跨外层、按已观察结果自适应选择 M 或筛掉内层失败样本,都要重新分析联合分布和选择偏差。

迁移练习 ​

若 g(y,t)=a(y)t+c(y) 且相关项可积,塔式性质使任意固定 M 都无偏,内层增加主要影响方差。若 g(t)=log⁡t,只知道 t>0 不够使用上面的统一二阶导界,因为 |g″(t)|=t−2 在零附近无界;还应确认内层均值为正,并控制其靠近零的概率与相应矩。将一个无偏似然估计取对数后宣称仍无偏,正是本页要防止的错误。

参考资料
  • Tom Rainforth, Rob Cornish, Hongseok Yang, Andrew Warrington, Frank Wood,On Nesting Monte Carlo Estimators,PMLR 80,2018,4267–4276,§3、Theorems 1–3及§4.1、§4.4。本文为单层嵌套写出可直接验证的充分条件与自含证明,并独立计算高斯平方和绝对值例,不将一般界冒充最优下界。
  • 内层条件化、MSE恒等式和线性情境费用分别复用条件期望、偏差方差及Monte Carlo旧页。
关系图谱16 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系