Skip to content

方法Method

Monte Carlo 积分

Monte Carlo integration · Monte Carlo quadrature

将积分改写为随机变量期望,以独立样本均值估计并用方差和概率假设量化随机误差。

形式陈述 ​

设目标积分可写成随机变量的期望

I=E[Y],Y=f(X),

其中 X 可按已知分布独立抽样。若可测区域 D 的体积 V 满足 0<V<∞,X 在 D 上均匀分布,则

∫Dg(x)dx=VE[g(X)].

更一般地,若 X 的密度为 p,且在 g≠0 的区域有 p>0,则在 p>0 处取 Y=g(X)/p(X),并将 p=0 处的比值定义为 0;后者是采样分布下的零测集。密度选择改变估计量方差,却不能遗漏积分质量所在的支撑。

给定 N≥1 个IID 样本 X1,…,XN,基本估计量为

I^N=1N∑i=1Nf(Xi).

若 E|Y|<∞,它无偏且由大数律收敛到 I。若还满足

σ2=Var(Y)<∞,

则

Var(I^N)=σ2N,SE(I^N)=σN.

当 N≥2 时,未知方差通常用

sN2=1N−1∑i=1N(f(Xi)−I^N)2

估计。在线、有限精度实现可用稳定的均值—平方差递推,避免由两个巨大近似量相减计算方差。

有限二阶矩下,对 Y 与 Y2 应用大数律可得 sN2→σ2 几乎必然。对 IID、0<σ2<∞ 的情形,中心极限定理给出以真实 σ 标准化的正态极限,Slutsky 定理再允许用一致的 sN 替换它。因此固定 0<α<1 时,在相应渐近区的近似 1−α 置信区间为

I^N±z1−α/2sNN.

这是一项概率覆盖声明,不是确定性误差上界。有限 N、偏态或重尾会使正态近似覆盖率偏离标称值;若需要非渐近保证,必须使用与有界性或尾部假设匹配的集中不等式。

输入应包含采样器、被积函数、样本预算或目标标准误、置信水平和随机数种子策略;输出应包含估计值、标准误或区间、样本数以及随机流信息。固定 N 时需 N 次抽样与函数求值,另有 O(N) 的标量累加工作;总成本应加上采样与求值的实际开销。在线累加只保存 O(1) 个标量,但还需当前样本、采样器状态以及求值所需的存储。独立样本还能直接并行分批归约。

若以半区间宽度

z1−α/2sNN≤atol+rtol|I^N|

作为停止条件,应设置最小批量和最大样本数,并承认反复查看同一普通置信区间后自适应停止会改变名义覆盖率。需要严格顺序覆盖时,应采用专门的序贯有效区间;否则状态应写成“达到渐近标准误目标”,而不是“真误差已小于容差”。

直觉
Monte Carlo 积分的随机样本均值

图中采用均匀抽样的未缩放被积函数记号:图里的 f 对应开头的 g,σ2=Var(g(X)),样本均值还要乘以体积 |D|,所以估计量方差为 |D|2σ2/N。上面的统一记号则把体积因子吸收到 Y=f(X) 中。

Monte Carlo 把面积变成随机函数值的平均。增加维数不会改变样本均值的 N−1/2 指数,因为平均的方差仍按 1/N 缩小;但常数 σ 完全由被积函数和采样分布决定,可能随维数恶化。所谓“速率不直接依赖维数”不能省略这一方差常数。

每次抽样都像从积分质量中取一张随机切片。独立性让涨落不持续同向累积,方差描述切片之间的散布;样本均值越稳定,只能说明在概率模型下典型误差变小,不会形成包住真积分的确定性夹逼。

例子与边界

对一维积分

I=∫01x2dx=13,

取 X∼Uniform(0,1),则 Y=X2,并有

Var(Y)=15−19=445.

因此基本估计量的理论标准误为 2/45N。误差只按 N−1/2 缩小;相比之下,二点 Gaussian 规则对该二次函数已经精确。这说明一维光滑积分通常不应仅因 Monte Carlo 易实现就放弃确定性高阶结构。

维数升高时,指数仍为 −1/2,方差却可能增长。对 [0,1]d 上

g(x)=2d∏j=1dxj,

积分为 1,均匀抽样下却有

Var(g(X))=(43)d−1.

这个例子防止把“维数无关速率”误读为“样本量与维数无关”。通过重要性采样让 p 更贴近 |g| 可降低方差,但若 p 在重要区域过小,权重 g/p 会形成重尾,反而让方差巨大或无穷。

当 Y 只有有限均值而方差无穷时,大数律仍可能给一致性,sN/N 和普通中心极限定理区间却不再有效。伪随机生成器质量不足、样本意外相关或并行流重叠也会破坏 σ2/N 公式。普通 IID Monte Carlo 没有 burn-in 概念;burn-in 属于从 Markov 链获取相关样本的另一套方法,不能作为本页基线算法的泛化警告。

推论与应用

方差缩减的共同目标是改变估计量或抽样分布,同时保持目标期望不变。重要性采样以权重换取更合适的访问频率;控制变量利用已知期望的相关量抵消波动。任何改造都应重新推导无偏性、方差和样本相关结构,而不是只比较一次随机运行。

随机化算法提供随机成本与成功概率的语言,中心极限定理解释渐近误差条。可复现实验应记录种子或随机流划分,但同一种子只让计算可重复,不会把随机置信区间变成确定性证明。

先确定误差来自哪一层 ​

纯积分问题的目标 I 可以是已知分布下的固定常数,此时MCSE只描述算法的随机模拟误差。如果积分中的分布或参数来自一份随机资料 Dn,还应定义理想数据估计量 Tn=T(Dn)。设固定资料后,N次模拟产生 Tn,N,计算程序实际返回 T~n,N。对真实目标 θ,有精确拆分

T~n,N−θ=Tn−θ⏟统计抽样误差+Tn,N−Tn⏟模拟误差+T~n,N−Tn,N⏟数值或优化误差.

三项必须以同一目标和同一单位比较。若模拟程序条件无偏,即 E(Tn,N∣Dn)=Tn,且相关二阶矩有限,条件均值零使前两项的交叉乘积期望为零。因此由全方差公式,

E(Tn,N−θ)2=E(Tn−θ)2+E{Var(Tn,N∣Dn)}.

这里第一项包含统计偏差的平方;不能把它自动缩写为统计方差。若模拟本身有条件偏差,需另加其平方及与统计误差的交叉项。最后的数值误差也通常与前两项有关,不能未经证明把三个标准误平方相加。

用一个可解模型看规模。原始资料 Xi∼N(θ,1) IID,n=100,理想估计量 Tn=X¯。假设模拟额外加入 N 个独立于资料、均值零方差4的噪声平均,则统计方差为0.01,条件模拟方差为 4/N。N=400 时两者相同;把 N 增至40000后,MCSE降到0.01,只是统计标准误0.1的十分之一,原始资料的0.1不会随着模拟次数继续增加而消失。

再假设求解器在模拟准则 q(t)=(t−Tn,N)2/2 上有经认证的目标差 r,则 |T~n,N−Tn,N|≤2r。若要数值误差不超过0.001,需 r≤5×10−7。这项界来自准则曲率,不能把“相邻两轮目标几乎不变”当作相同证书。一般曲率和统计尺度的联动见统计与数值误差预算;本例增加的是固定数据后的模拟层。

一千行不一定是一千个独立重复 ​

设第 g 个独立外层情境为 Ag,EAg=μ、Var(Ag)=τ2。在每个情境内产生 R 个噪声 εgj,它们彼此及与全部 Ag 独立,均值零、方差 σ2,输出 Ygj=Ag+εgj。总共有 GR 行,但总体均值估计

Y¯=1G∑g=1G(1R∑j=1RYgj)

的方差是

Var(Y¯)=τ2G+σ2GR.

证明只需先把每个独立情境平均成 Wg=Ag+ε¯g,其方差为 τ2+σ2/R,再对 G 个独立 Wg 平均。同情境两行的协方差为 τ2,所以把 GR 行当IID会错误得到 (τ2+σ2)/(GR)。例如 G=10,R=100,τ2=σ2=1,真实方差0.101,逐行IID公式仅0.002,少了50.5倍。正确的重复运行MCSE应从10个 Wg 估计,而不是从1000行直接估计。

固定 G 只增加内层重复 R,方差仍停在 τ2/G。如果生成一个新情境成本为 a>0,每个内层输出成本为 b>0,预算近似为 C=G(a+bR),则在 τ2,σ2>0 下,连续分配问题的方差为

(τ2+σ2/R)(a+bR)C=aτ2+bσ2+bτ2R+aσ2/RC.

对最后两项求导,或用两正数和的下界,得到候选 R∗=aσ2/(bτ2)。实际取 R≥1 的整数并验证可用 G;公式只对应本例线性条件均值及固定成本模型。一般非线性内层插件还可能有偏差,不能把这条分配推广成通用嵌套模拟定理。

方差缩减之后,重新数独立单位 ​

控制变量使用调整后贡献;独立先导训练的系数应在主样本分析中冻结,同样本拟合则另用渐近论证。对偶抽样的独立单位是一对的平均,共同随机数的是两个方案的配对差。分层模拟保留层权重和层内方差,不能把不等配额的所有输出当同分布数据。U统计量的核行共享原始输入,即使计算了全部两两组合,也没有创造同样多的独立信息。

Bootstrap更需要区分原始样本量 n 与重采样次数 B。固定资料后增加 B,能够更精确地描述给定资料的条件重采样律,却不会增加原始抽样信息。该页的样本最大值例证明,条件律在零点保留约0.632的原子;把 B 增到无限大,只会更准确地计算这条错误近似,不能修复其统计失效。

预算增加后,究竟是哪一项误差变小 ​

随机化设计也可以把许多函数调用打包为一个独立贡献。随机化拟Monte Carlo每次随机化整套低差异点,再跨独立整网估计MCSE;整网内部的均匀边缘只保证中心正确,不能沿用逐行IID方差。若模拟器存在精度层级,多层Monte Carlo把目标近似写成粗层加相邻耦合差,层差方差决定各层次数,最细层的弱偏差则需要独立保证。

对内层均值作非线性变换时,单纯重新数独立外层仍不够。非线性嵌套模拟中,设每层条件噪声方差为1,外层目标为标准正态情境均值的平方期望;内层只抽 M 次再平方,会留下精确偏差 1/M。增加外层次数能把MCSE压到零,却不改变这个偏差。因此应分别记录外层 N、内层 M、插件中心和偏差控制,不能把前面的线性随机效应最优配额直接套用。

还有一种预算是在固定资料后少算昂贵核。不完全U统计量的抽子集MCSE只描述计算层;即使把完整核平均算得精确,原始资料的抽样误差仍在。这四种协议分别要记录整网、耦合层差、完整外层情境、固定资料后的子集抽取;“总输出行数”不足以确定任何一种完整误差报告。

参考资料
关系图谱32 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系