Skip to content

统计模型的可识别性

Identifiability of a statistical model · Parameter identifiability

不同参数值是否能够产生相同观测分布,以及目标泛函能否由分布唯一确定。

形式陈述

参数化统计模型 {Pθ:θΘ} 称为可识别,若映射

ΘP,θPθ

是单射,即

Pθ=Pθθ=θ

对所有 θ,θΘ 成立。等号表示两个分布对每个可测事件给出相同概率,而不是密度在某个任意版本下逐点相等。

即使完整参数不可识别,目标 g:ΘT 仍可能可识别。精确条件是

Pθ=Pθg(θ)=g(θ).

此时 g 在由等价关系 θθPθ=Pθ 得到的商空间上有良好定义。可识别性因此总要连同“观测了什么”和“想推断什么”说明。

直觉

若两个参数产生完全相同的数据分布,再多样本也无法仅凭这些数据区分它们。困难不是算法不够好,而是实验中没有携带区分信息。可识别性是开始讨论一致估计之前的逻辑门槛。

不可识别常来自冗余坐标、对称性或潜变量未被观测。解决方式可以是约束参数空间、改用等价类参数,或收集能打破对称性的额外观测;单纯增加同类样本量不会改变分布相同这一事实。

例子与计算

正态模型 N(μ,σ2) 在参数空间 μR,σ>0 上可识别,因为相同分布必有相同期望与方差。若允许 σR{0},则 σσ 产生同一分布,参数化不再可识别;改用方差 v=σ2>0 可消除冗余。

两成分混合

Pθ=πN(μ1,1)+(1π)N(μ2,1)

在不加约束时具有标签交换:

(π,μ1,μ2)(1π,μ2,μ1).

完整有序三元组不可识别,但混合分布本身和无序集合 {(π,μ1),(1π,μ2)} 可识别到标签置换。约束 μ1<μ2 可选定一个代表,不过在 μ1=μ2 的退化边界仍会失效。

观测机制也能制造不可识别。设潜在 XBernoulli(p),但设备只报告两次独立试验是否相同:Y=1{X1=X2}。则

Pp(Y=1)=p2+(1p)2=P1p(Y=1),

所以从任意多次同类 Y 观测都无法区分 p1p。目标 p(1p) 仍可识别,而 p 本身除非加约束 p1/2 就不可识别。这说明可识别性属于“潜在模型加观测映射”的组合,而非只看潜变量分布。

边界与失败情形

可识别不等于容易估计。两个分布虽不相同,却可以任意接近;有限样本下仍难区分,估计方差也可能巨大。弱识别讨论的正是这种局部近退化,需用 Fisher 信息或实验距离进一步量化。

不可识别也不表示数据毫无信息。若只观测 Y=θ2+ε,符号通常不可识别,但 |θ|θ2 仍可估计。把“不能恢复原标签”夸大为“无法推断任何目标”是不正确的。

密度依赖支配测度和零测集版本。证明 pθ(x)=pθ(x) 对几乎处处 x 成立可推出分布相同;反过来也只能保证密度几乎处处相等,不要求每一点一致。

结构可识别性是总体分布层面的性质,有限样本可识别性、后验多峰和优化局部极值是相关但不同的问题。数值算法找不到唯一解不能单独证明模型不可识别。

反过来,有限样本出现相同似然值也不能证明不可识别。可识别性比较的是对所有可能观测事件的完整分布;某一份数据恰好给两个参数相同似然,只说明这次观测没有打破平局。

推论与应用

若存在对每个 θ 都一致收敛到 θ 的估计量,则参数至少必须可识别:相同的数据分布不可能让同一统计量序列分别收敛到两个不同常数。这给出可识别性作为一致估计必要条件的直接论证。

潜变量模型、因果模型、矩阵分解和神经网络常带置换、缩放或旋转对称性。报告结果时应针对可识别的预测分布或商空间目标,而不是为方便解释而假装任意坐标标签具有数据支持。

参考资料
  • Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 1。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,§1.5。
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,关于统计模型与可识别参数的章节。