Skip to content

定义Definition

统计模型与参数

Statistical model · Statistical parameter

对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。

形式陈述 ​

统计模型规定可观测数据可能服从哪些分布。在可测样本空间 (X,A) 上,它是一个候选分布族

P⊆{P:P 是 (X,A) 上的概率测度}.

样本空间说明会观察到什么,模型说明允许哪些生成规律。模型可以借助参数写成 P={Pθ:θ∈Θ};这里 Θ 是参数空间,θ↦Pθ 是一种参数化,但不同 θ 不必对应不同分布。

待推断的统计参数也可以直接定义成分布的泛函

ψ:P→Ψ.

例如在均值存在的模型中,ψ(P)=∫xdP(x);也可以取事件概率、分位数或回归函数。θ 是描述模型的坐标,ψ(P) 是研究要回答的问题,两者可能一致,也可能只部分相关。

若 ψ(Pθ)=g(θ),那么 g 能成为可观测分布的良定义参数,当且仅当

Pθ=Pθ′⇒g(θ)=g(θ′).

整个参数化可辨识则要求 Pθ=Pθ′⇒θ=θ′。可辨识性检查分布是否足以区分参数,而不是检查某一次样本是否足够精确。这里有两个不同问题:坐标 θ 可能冗余,但目标 g(θ) 仍可能可辨识;因此应先检查研究目标是否在同分布的参数标签上取相同值,再决定是否需要重参数化整个模型。

直觉

统计建模有三件需要分开的事:我们实际记录什么,哪些分布与这些记录方式相容,以及最终关心分布的哪一项性质。把三者混在一个参数符号里,容易把采样假设或观察不到的信息偷偷带进结论。

例如重复记录请求是否成功,可把一次观测写成 X∈{0,1},候选模型为 Bernoulli 分布族 Pθ(X=1)=θ、Pθ(X=0)=1−θ,其中 θ∈[0,1]。若关心成功概率,那么目标参数就是 θ;若关心失败概率,则目标为 1−θ,并没有换掉候选分布族。

一次观测的模型还没有说明多次观测如何相关。额外假设 X1,…,Xn 独立同分布时,完整样本的分布才是 Pθ⊗n。若相邻请求共享故障状态,边际成功概率相同并不保证独立,直接使用乘积分布就增加了未经模型本身提供的假设。

例子与边界

参数、统计量与估计值 ​

在上述独立同分布 Bernoulli 模型中,θ 是未知参数,

θ^=1n∑i=1nXi

是估计量:它是一份随机样本的函数,在重复采样中会变化。拿到具体数据 x1,…,xn 后算出的数字 1n∑ixi 才是这次的估计值。参数未知并不自动使它成为随机变量;给参数再配一个先验分布是 Bayesian 模型中的额外建模步骤。

若使用正态模型 N(μ,σ2) 并只关心均值,μ 是目标参数,σ2 是干扰参数。干扰只表示它不是主要目标,不表示它已知或可以忽略;均值估计的不确定性仍受方差影响。

可辨识性先于估计精度 ​

考虑 Pθ=N(θ2,1),θ∈R。有 P2=P−2,所以符号无法从可观测分布中辨认,整个参数化不可辨识;但 θ2 和 |θ| 对这两种标签都相同,可以作为分布的参数。把参数空间限制成 [0,∞),则能去掉这种重复标签。

为什么增加样本也不能恢复符号?对任何 n,P2⊗n=P−2⊗n,所以任何基于样本的统计量在这两种情形下都有同一分布。问题不是估计方法还不够聪明,而是两个标签对全部观测给出的预测完全一致。混合模型交换成分标签,也会出现同类的参数化冗余。

这也能给出“不可能一致估计符号”的简短论证。假设某估计量在 θ=2 时以趋于一的概率落入 (1,3),由于它在 θ=−2 时分布完全相同,该概率仍趋于一,便不可能同时以趋于一的概率落入 (−3,−1)。两个不相交邻域无法同时获得概率一。

可辨识仍不保证有限样本易于估计。两种参数产生的分布可以不同,却非常接近;辨认它们需要多少数据,是进一步的统计精度问题。

观察机制可以改变模型本身 ​

设潜在时间为 T,但记录系统在截止时间 C 后停止观察,只留下 Y=min(T,C) 和指示量 Δ=1{T≤C}。真正的观测是 (Y,Δ),而不是完整的 T。可观测模型必须由 T,C 的联合规律及记录方式推出;只写一个 T 的分布族,不能自动得到实际数据的似然。

比如已知固定截止时间 C=c、T 连续时,事件 Δ=1 的一次记录贡献密度 fθ(y),而记录 (c,0) 贡献生存概率 Pθ(T>c)。它表达的是“时间超过 c”,不能误写成恰在 c 发生事件的 fθ(c)。

回归也有类似分工。固定设计把输入位置 xi 当作实验给定条件,随机设计则把输入变量的分布纳入联合模型。条件分布 P(Y∣X=x)、输入分布与联合分布之间有关联,但它们不是未经约定即可互换的同一对象。

参数化维数与假设强度 ​

常见参数模型用固定有限维坐标描述一个具有指定结构的分布族,例如正态族;非参数模型允许更丰富的分布形状,例如所有具有有限二阶矩的实数分布。非参数不等于没有假设,矩条件、光滑性与独立性都可能是重要限制。

半参数模型可以同时具有有限维目标和无限维未知部分;随样本量增长的有限维逼近则常用于逼近更大的模型。区分这些情况看的是模型的结构及渐近设定,不能只数某个程序最终保存了几个数字。扩大模型意味着排除的候选规律更少,却不自动保证推断更准确;往往需要付出更多样本或更弱结论的代价。

推论与应用

似然建立在已声明的观测模型上 ​

若所有 Pθ 相对于同一个与 θ 无关的支配测度 ν 有密度 pθ,观察到 x 后,似然为 L(θ;x)=pθ(x)。此时固定的是数据,变化的是参数;它不要求对 θ 的积分等于 1。

在独立同分布样本模型下,L(θ;x1,…,xn)=∏ipθ(xi)。乘积来自独立性,不是“似然”一词本身包含的规则。有删失、选择或依赖时,要使用对应观测模型的联合密度或概率,而不是机械相乘。

模型正确性与推断保证 ​

置信区间的覆盖概率、检验的错误率和估计量的风险,都是在指定分布及采样机制下定义的。改变模型可能改变这些保证,即使计算程序完全没有变化。评价一种方法时,应先问保证针对单个 P、整个模型族,还是某个局部范围成立。

若真实分布 Q 不属于 P,就发生模型失配。在适当的正则条件下,一些基于准则的估计量会逼近该准则在 Q 下的最优参数,常称伪真参数。例如对数似然相关准则常与 KL 意义下的逼近有关,但最优点是否存在、唯一及估计量是否收敛,都需要额外条件;不能说任意失配方法都会自动收敛到一个唯一的“最近模型”。

实践中的清晰起点是同时写出观测变量、候选联合分布和目标泛函,再检查可辨识性。只有这三项对齐,选择估计方法、计算不确定性和讨论稳健性才是在回答同一个问题。

参考资料
  • Larry Wasserman,CMU 36-705,Lecture Notes 10: Statistical Models:统计模型、参数与估计的基本区分。
  • George Casella、Roger L. Berger,Statistical Inference,第 2 版,第 6–7 章:样本统计量、参数估计及似然。
  • A. W. van der Vaart,Asymptotic Statistics,第 5 章:基于准则的估计、可辨识性及一致性条件。
  • Halbert White,Maximum Likelihood Estimation of Misspecified Models,1982:模型失配下极大似然的目标与正则条件。
关系图谱67 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例