“后续可按目标分流:若关心固定样本平均,先读大数律,并尝试说明把 $(a,a,b)$ 改排成 $(b,a,a)$ 为什么不改变经验积分;若关心模型选择,读经验风险与泛化间隙,检查为什么选出的…”
“对固定的 (D) 可积函数 (f),从同一无限 IID 序列取前 (m) 项,大数律给出以下几乎必然收敛((m\to\infty))”
定理Theorem
Law of large numbers · Strong law of large numbers · SLLN
独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。
设
Kolmogorov 强大数定律断言样本均值几乎必然收敛:
几乎必然收敛蕴含依概率收敛,因此本定理也给出弱形式的收敛结论;有限方差弱大数定律中额外的定量偏差界则需另用方差估计。两者的假设、证明工具和结论量词应分别陈述,不能把 Chebyshev 证明误当成强大数定律的证明。
强大数定律把“概率是长期频率”从解释升格为路径级定理:除一个概率为零的例外集合外,一次实验持续做下去,样本均值终会稳定到期望。它不是只对每个固定
公平硬币前
可积性不可省略。若
大数定律为Monte Carlo 方法背书:把积分或期望写成
矩估计与经验准则常先用 LLN 证明样本摘要趋于总体目标,再借连续映射或 argmin 定理得到估计一致性。逐参数 LLN 只给 pointwise consistency;若估计量在同一数据上跨参数或模型取最优,还需统一大数律、可识别的分离极值与优化误差控制。
大数定律只回答“收敛到哪”,不回答“多快”:有限正方差的 IID 情形可进一步用中心极限定理刻画涨落,而对有界随机变量,Hoeffding 不等式提供非渐近的指数式偏差界。
在信息论中,对独立同分布的离散信源且熵有限时,把大数定律用于
若样本代表周期长度,更新计数大数定律用路径夹逼把平均耗时反演成单位时间周期数;周期再携带收益时,更新报酬定理得到平均收益除以平均长度。远处固定小窗口的期望次数则是另一个问题,需要Blackwell 更新定理及其非格点条件。
正在载入交互图谱…