Skip to content

独立同分布样本

IID sample · Independent and identically distributed sample

以乘积分布描述来自同一总体的独立重复观测。

形式陈述

(Z,A) 是可测空间,D 是其上的概率分布。随机变量 Z1,,Zm 若相互独立且每个都服从 D,就称为来自 D 的大小为 m 的独立同分布(IID)样本。写作

S=(Z1,,Zm)Dm,

其中 Dm乘积测度S 是随机向量;观测完成后得到的 s=(z1,,zm) 才是一份具体数据。概率陈述必须区分对随机样本 S 取概率与对实现值 s 做确定性计算。

“同分布”只规定每个坐标的边缘律相同,不推出独立;“独立”也不推出同分布。IID 同时包含两项条件。

直觉

IID 模型把重复实验理想化为:每次都从同一个总体机制重新抽取,而且新一次结果不携带此前结果的信息。联合分布因此完全分解为单观测分布的乘积,许多似然、期望和集中证明也随坐标分解。

样本通常写成有序元组,是因为乘积空间保留坐标身份。统计量可以忽略顺序,但这种置换不变性是统计量的性质,不是把概率空间自动改成集合。重复观测尤其不能删除。

例子与边界

抛同一枚公平硬币 m 次并假设各次独立,得到 Bernoulli(1/2)m 的 IID 样本。令 Z1==Zm=Z,各坐标边缘仍相同,却只含一次随机信息,因此不是独立样本。若 ZiN(i,1) 且彼此独立,则独立但不同分布,也不是 IID。

有限总体不放回抽样的坐标通常负相关;时间序列常有自相关;在线学习和 bandit 中第 t 个观测依赖此前动作。它们都可能拥有相同边缘分布,却不能直接套用 Dm 下的集中结论。

把样本当成集合会丢失重复次数。离散数据 s=(a,a,b) 与集合 {a,b} 不同:前者包含三次观测,后者只记录两个不同值。bootstrap、经验频率和似然都需要保留多重性。

推论与应用

对固定可积函数 f,样本平均

1mi=1mf(Zi)

在适当条件下由大数律趋近 EDf。把具体样本写成经验测度可将该平均表示为积分;IID 是数据生成协议,经验测度则是观测后的确定性摘要,两者不能合并成同一对象。

统计推断、经验风险和分布测试常以 IID 为基线。若数据协议偏离 IID,应明确替代假设,例如有限总体设计、混合条件、鞅差、自适应采样或分布漂移,而不是把“样本数量大”当成独立性的证明。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998, Chapters 2 and 19.
  • Olav Kallenberg, Foundations of Modern Probability, 2nd ed., Springer, 2002, Chapters 3–5.
  • Shai Shalev-Shwartz and Shai Ben-David, Understanding Machine Learning, Cambridge University Press, 2014, Chapter 2.