形式陈述 ​
参数化统计模型
是单射,即
对所有
即使完整参数不可识别,目标
此时
直觉 ​
若两个参数产生完全相同的数据分布,再多样本也无法仅凭这些数据区分它们。困难不是算法不够好,而是实验中没有携带区分信息。可识别性是开始讨论一致估计之前的逻辑门槛。
不可识别常来自冗余坐标、对称性或潜变量未被观测。解决方式可以是约束参数空间、改用等价类参数,或收集能打破对称性的额外观测;单纯增加同类样本量不会改变分布相同这一事实。
例子与计算 ​
正态模型
两成分混合
在不加约束时具有标签交换:
完整有序三元组不可识别,但混合分布本身和无序集合
观测机制也能制造不可识别。设潜在
所以从任意多次同类
边界与失败情形 ​
可识别不等于容易估计。两个分布虽不相同,却可以任意接近;有限样本下仍难区分,估计方差也可能巨大。弱识别讨论的正是这种局部近退化,需用 Fisher 信息或实验距离进一步量化。
不可识别也不表示数据毫无信息。若只观测
密度依赖支配测度和零测集版本。证明
结构可识别性是总体分布层面的性质,有限样本可识别性、后验多峰和优化局部极值是相关但不同的问题。数值算法找不到唯一解不能单独证明模型不可识别。
反过来,有限样本出现相同似然值也不能证明不可识别。可识别性比较的是对所有可能观测事件的完整分布;某一份数据恰好给两个参数相同似然,只说明这次观测没有打破平局。
推论与应用 ​
若存在对每个
潜变量模型、因果模型、矩阵分解和神经网络常带置换、缩放或旋转对称性。报告结果时应针对可识别的预测分布或商空间目标,而不是为方便解释而假装任意坐标标签具有数据支持。
参考资料
- Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 1。
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,§1.5。
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,关于统计模型与可识别参数的章节。