形式陈述
统计模型规定可观测数据可能服从哪些分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。。在可测样本空间 上,它是一个候选分布族
样本空间说明会观察到什么,模型说明允许哪些生成规律。模型可以借助参数写成 ;这里 是参数空间, 是一种参数化,但不同 不必对应不同分布。
待推断的统计参数也可以直接定义成分布的泛函公理库函数Function · Map · Mapping由定义域、陪域和单值图共同组成,并把每个输入送到唯一输出的映射。
例如在均值存在的模型中,;也可以取事件概率、分位数或回归函数。 是描述模型的坐标, 是研究要回答的问题,两者可能一致,也可能只部分相关。
若 ,那么 能成为可观测分布的良定义参数,当且仅当
整个参数化可辨识则要求 。可辨识性检查分布是否足以区分参数,而不是检查某一次样本是否足够精确。这里有两个不同问题:坐标 可能冗余,但目标 仍可能可辨识;因此应先检查研究目标是否在同分布的参数标签上取相同值,再决定是否需要重参数化整个模型。
直觉
统计建模有三件需要分开的事:我们实际记录什么,哪些分布与这些记录方式相容,以及最终关心分布的哪一项性质。把三者混在一个参数符号里,容易把采样假设或观察不到的信息偷偷带进结论。
例如重复记录请求是否成功,可把一次观测写成 ,候选模型为 Bernoulli 分布族 、,其中 。若关心成功概率,那么目标参数就是 ;若关心失败概率,则目标为 ,并没有换掉候选分布族。
一次观测的模型还没有说明多次观测如何相关。额外假设 独立同分布时,完整样本的分布才是 。若相邻请求共享故障状态,边际成功概率相同并不保证独立,直接使用乘积分布就增加了未经模型本身提供的假设。
例子与边界
参数、统计量与估计值
在上述独立同分布 Bernoulli 模型中, 是未知参数,
是估计量:它是一份随机样本的函数,在重复采样中会变化。拿到具体数据 后算出的数字 才是这次的估计值。参数未知并不自动使它成为随机变量;给参数再配一个先验分布是 Bayesian 模型中的额外建模步骤。
若使用正态模型 并只关心均值, 是目标参数, 是干扰参数。干扰只表示它不是主要目标,不表示它已知或可以忽略;均值估计的不确定性仍受方差影响。
可辨识性先于估计精度
考虑 ,。有 ,所以符号无法从可观测分布中辨认,整个参数化不可辨识;但 和 对这两种标签都相同,可以作为分布的参数。把参数空间限制成 ,则能去掉这种重复标签。
为什么增加样本也不能恢复符号?对任何 ,,所以任何基于样本的统计量在这两种情形下都有同一分布。问题不是估计方法还不够聪明,而是两个标签对全部观测给出的预测完全一致。混合模型交换成分标签,也会出现同类的参数化冗余。
这也能给出“不可能一致估计符号”的简短论证。假设某估计量在 时以趋于一的概率落入 ,由于它在 时分布完全相同,该概率仍趋于一,便不可能同时以趋于一的概率落入 。两个不相交邻域无法同时获得概率一。
可辨识仍不保证有限样本易于估计。两种参数产生的分布可以不同,却非常接近;辨认它们需要多少数据,是进一步的统计精度问题。
观察机制可以改变模型本身
设潜在时间为 ,但记录系统在截止时间 后停止观察,只留下 和指示量 。真正的观测是 ,而不是完整的 。可观测模型必须由 的联合规律及记录方式推出;只写一个 的分布族,不能自动得到实际数据的似然。
比如已知固定截止时间 、 连续时,事件 的一次记录贡献密度 ,而记录 贡献生存概率 。它表达的是“时间超过 ”,不能误写成恰在 发生事件的 。
回归也有类似分工。固定设计把输入位置 当作实验给定条件,随机设计则把输入变量的分布纳入联合模型。条件分布 、输入分布与联合分布之间有关联,但它们不是未经约定即可互换的同一对象。
参数化维数与假设强度
常见参数模型用固定有限维坐标描述一个具有指定结构的分布族,例如正态族;非参数模型允许更丰富的分布形状,例如所有具有有限二阶矩的实数分布。非参数不等于没有假设,矩条件、光滑性与独立性都可能是重要限制。
半参数模型可以同时具有有限维目标和无限维未知部分;随样本量增长的有限维逼近则常用于逼近更大的模型。区分这些情况看的是模型的结构及渐近设定,不能只数某个程序最终保存了几个数字。扩大模型意味着排除的候选规律更少,却不自动保证推断更准确;往往需要付出更多样本或更弱结论的代价。
推论与应用
似然建立在已声明的观测模型上
若所有 相对于同一个与 无关的支配测度 有密度 ,观察到 后,似然为 。此时固定的是数据,变化的是参数;它不要求对 的积分等于 。
在独立同分布样本模型下,。乘积来自独立性,不是“似然”一词本身包含的规则。有删失、选择或依赖时,要使用对应观测模型的联合密度或概率,而不是机械相乘。
模型正确性与推断保证
置信区间的覆盖概率、检验的错误率和估计量的风险,都是在指定分布及采样机制下定义的。改变模型可能改变这些保证,即使计算程序完全没有变化。评价一种方法时,应先问保证针对单个 、整个模型族,还是某个局部范围成立。
若真实分布 不属于 ,就发生模型失配。在适当的正则条件下,一些基于准则的估计量会逼近该准则在 下的最优参数,常称伪真参数。例如对数似然相关准则常与 KL 意义下的逼近有关,但最优点是否存在、唯一及估计量是否收敛,都需要额外条件;不能说任意失配方法都会自动收敛到一个唯一的“最近模型”。
实践中的清晰起点是同时写出观测变量、候选联合分布和目标泛函,再检查可辨识性。只有这三项对齐,选择估计方法、计算不确定性和讨论稳健性才是在回答同一个问题。
参考资料
- Larry Wasserman,CMU 36-705,Lecture Notes 10: Statistical Models:统计模型、参数与估计的基本区分。
- George Casella、Roger L. Berger,Statistical Inference,第 2 版,第 6–7 章:样本统计量、参数估计及似然。
- A. W. van der Vaart,Asymptotic Statistics,第 5 章:基于准则的估计、可辨识性及一致性条件。
- Halbert White,Maximum Likelihood Estimation of Misspecified Models,1982:模型失配下极大似然的目标与正则条件。