Skip to content

先选要比较的问题,再给有限样本误差 ​

“近似服从Poisson”或“近似正态”还不是完整结论。需要同时交代随机模型、比较距离、样本规模和可算的误差预算。本终点先问任意计数事件的概率,再把目标换成平均超载;这两类问题允许使用的测试函数不同。

不同率的独立计数给精确基准,大小偏置与Chen–Stein方法给Poisson预算。后两项任务则使用正态方程、交换对与零偏置。

任务一:四种部件,先算出完整质量 ​

四个部件独立故障,故障率分别为

p=(.02,.05,.08,.15).

记W为故障总数。它的生成多项式为

GW(z)=(.98+.02z)(.95+.05z)(.92+.08z)(.85+.15z).

逐项卷积,或者执行原地逆序DP,得到按k=0,1,2,3,4排列的完整质量

P(W=k)=1500000(364021,122481,12981,511,6).

五个分子和为500000;按k加权的均值为.3。因而比较目标取 Z∼Poisson(.3),而不是另行拟合一个任意λ。

全事件保证和具体事件误差 ​

独立大小偏置按 pi/.3 选择一项并强制该项为1,得到

dTV(W,Z)≤∑ipi2=.0004+.0025+.0064+.0225=.0318.

例如“没有故障”的精确概率为.728042,Poisson给 e−.3≈.74081822,误差约.01277622。这个事件没有达到最坏差;完整TV约.02271653。

因为W最多为4,计算完整TV不必无穷求和:若 qk=e−.3(.3)k/k!,则

(1)dTV(W,Z)=12(∑k=04|P(W=k)−qk|+1−∑k=04qk).

最后一项正是Poisson落在5及以上的全部概率,不能因为W在那里没有质量就删掉它。公开脚本以有理Taylor尾界包住指数,并用区间加减与绝对值验证式(1)的上端严格小于.0318。

若把四个率全部替换成平均率.075,就改变成另一个二项模型。均值仍为.3,原方差为 .3−.0318=.2682,新方差为 4(.075)(.925)=.2775。同均值没有保留异质性,不应把这个模型替代当作精确计算。

任务二:重叠的11不再是独立事件 ​

现在输入变成20个独立Bernoulli(.1)位 Y1,…,Y20。统计

W=∑i=119YiYi+1.

这里共有19个“出现11”的指标。相邻指标共享一位,因此不能把它们当成19次独立Bernoulli(.01)。原始位数和计数指标数已经不同。

写出实际邻域 ​

对 Ii=YiYi+1,取 Bi={i−1,i,i+1}∩{1,…,19}。邻域外全部指标使用的原始位与 Yi,Yi+1 不交,故满足整向量独立条件。

19个邻域中,两端各大小2,其余17个各大小3,因此

λ=19(.1)2=.19,b1=(2⋅2+17⋅3)(.1)4=.0055.

共有18对相邻指标,每对共同成功的概率为(.1)³;有向求和计两次,所以

b2=2⋅18(.1)3=.036,dTV(W,Poisson(.19))≤.0415.

若忽略共享位,仅算 19(.01)2=.0019,使用的条件已经不成立。这不是一个更聪明的精度估计。

精确计算需要额外记忆 ​

令 aj(k,b) 记录前j位中出现k次11且末位为b的概率。附加下一位z时,计数增加bz,因此

aj+1(k+bz,z)+=aj(k,b)(.1)z(.9)1−z.

从 a0(0,0)=1 开始,处理20位后对末位求和,就得到完整20项质量。相比第一题,只保存计数已不够,还需知道是否刚留下一个1。

计算结果为

P(W=0)=.83882575688449447359,P(Z=0)=e−.19≈.82695913394336232.

零次事件差约.01186662,完整TV约.02085346,都在.0415之内。DP允许一次11与下一次11重叠,例如111贡献两次;若任务改成不重叠匹配或“至少有一段长串”,必须重新定义状态和计数。

两个模型的Poisson误差预算

后两题把标准化负载与标准正态分布比较,误差使用一阶Wasserstein距离。先确认目标分布和距离的含义,再判断平均超载这类Lipschitz损失能得到什么保证;它与前两题的全事件概率误差不同。

任务三:无放回抽样中的正态预算 ​

给定一个固定总体:100个值为+1,100个值为−1。均匀地无放回抽100个,令S为选中标签集合,K为其中的正值个数。定义

T=∑i∈Sai=2K−100,σ2=10000199,W=T/σ.

总体方差以分母200计算等于1;无放回总和方差是 m(N−m)/(N−1),所以W均值为零、方差为一。若误用100个独立±1之和的方差100,标准化就错了。

一次内外交换形成可交换对 ​

从S中均匀选一个标签I,从补集中均匀选J,并交换两者。每个具体交换与其反向都具有相同概率,故 (W,W′) 可交换。条件信息取整个原始集合 G=σ(S)。

给定K=k,W增加 2/σ 的概率为 (100−k)2/10000,减少同样幅度的概率为 k2/10000。其余情况不变。因此

E[Δ∣S]=−150W,λ=150,V(S)=E[Δ2∣S]=4σ2k2+(100−k)210000.

联合交换性决定 EV=2λ,却没有使每个S的V都等于2λ。必须保留随机缺口

A=E|1−V(S)2λ|.

精确的K质量为

P(K=k)=(100k)(100100−k)(200100)=(100k)2(200100),k=0,…,100.

所以A是101项有理数之和,计算得 A≈.004867389500646295。公开结果保留其精确分数。

第三跳跃项与输出承诺 ​

非零跳跃的绝对值都为2/σ。因此

E|Δ|32λ=2σEΔ22λ=2σ≈.28213471959331769.

交换对定理给出

(2)dW(W,Z)≤2/πA+2σ≈.28601833452729734.

这份预算同时控制所有1-Lipschitz目标的期望误差。它并不宣称每个目标都误差这么大。例如h(w)=max(w,0)的精确期望为

Eh(W)=∑k=0100P(K=k)max(2k−100,0)σ≈.39645421161476625.

正态目标为 Eh(Z)=1/2π≈.39894228040143268,实际误差约.00248807,显著小于式(2)。这揭示充分上界的保守性,而不是取消其统一保证。

本题的入选指标存在全局总数约束,独立重抽一个坐标会离开原样本空间。使用内外交换既保持样本规模,又给出正确的条件回归;它是第一、二题之外的另一种依赖结构。

任务四:独立负载的零偏置和超容量损失 ​

改为400个独立公平Bernoulli负载,令

W=∑i=1400(Bi−1/2)10.

每项方差为1/4,总方差为100,所以分母为10。这次没有固定总体的无放回约束。

均匀选I,将 BI−1/2 替换成独立 UI∼Uniform[−1/2,1/2],其他项不变:

W∗=W+UI−(BI−1/2)10.

按方差选索引在这里恰为均匀选择。原两端点到区间均匀点的平均距离都是1/2,故

E|W−W∗|=120,dW(W,Z)≤110.

对h(w)=max(w,0),精确二项求和给 Eh(W)≈.39869301963792928,与正态答案的差约.00024926。h无界,却是1-Lipschitz,因此0.1的证书适用。若把目标换成某个不连续事件指示函数,不能原封不动使用同一W1预算。

两种不同的分布变换

图中的两类变换分别按均值与方差组织和的替换。零偏置的输入均值为零,但输出均值可以不为零;例如Bernoulli(1/4)中心化后的零偏置均匀分布在[−1/4,3/4],均值为1/4。

复算与适用边界 ​

下载公共检查脚本和本次结果。脚本需要Python 3与mpmath;在已具备这些依赖的环境运行:

sh
python foundations-distribution-approximation-check.py --output my-results.json

有限分布、条件回归、密度归一化和多项式测试恒等式使用Fraction精确复算。Poisson的TV通过有理指数包围判断,保存的有理端点是严格包围;同时打印的小数只作近似读数。Gaussian Stein函数的605组核检查等使用100位算术,是有限诊断,不替代正文对全部Lipschitz函数的证明。

当前共25980项检查通过,包括不同率Bernoulli的完整枚举、119个依赖三位模型的大小偏置、三点零偏置密度、异质独立和替换、不同有限总体的无放回交换以及重叠模式DP。把各参数换成新值时,还需重新核对独立性、条件信息、方差非零、矩条件和所选目标函数。

尤其要保留距离的区别:这些离散W到连续正态的总变差均为1,即使其W1和某个平均超载误差很小。Poisson预算则直接面向所有计数事件。完成后可返回“有限样本分布近似的误差证书”路线,按自己真正要控制的输出选择工具。