“设 ((\mathcal Z,\mathcal A)) 是可测空间,(D) 是其上的概率分布。独立同分布样本描述数据的随机生成协议:”
形式陈述 ​
设
其中
“同分布”只规定每个坐标的边缘律相同,不推出独立;“独立”也不推出同分布。IID 同时包含两项条件。
直觉 ​
IID 模型把重复实验理想化为:每次都从同一个总体机制重新抽取,而且新一次结果不携带此前结果的信息。联合分布因此完全分解为单观测分布的乘积,许多似然、期望和集中证明也随坐标分解。
样本通常写成有序元组,是因为乘积空间保留坐标身份。统计量可以忽略顺序,但这种置换不变性是统计量的性质,不是把概率空间自动改成集合。重复观测尤其不能删除。
例子与边界 ​
抛同一枚公平硬币
有限总体不放回抽样的坐标通常负相关;时间序列常有自相关;在线学习和 bandit 中第
把样本当成集合会丢失重复次数。离散数据
推论与应用 ​
对固定可积函数
在适当条件下由大数律趋近
统计推断、经验风险和分布测试常以 IID 为基线。若数据协议偏离 IID,应明确替代假设,例如有限总体设计、混合条件、鞅差、自适应采样或分布漂移,而不是把“样本数量大”当成独立性的证明。
参考资料
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998, Chapters 2 and 19.
- Olav Kallenberg, Foundations of Modern Probability, 2nd ed., Springer, 2002, Chapters 3–5.
- Shai Shalev-Shwartz and Shai Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chapter 2.