“接下来的层级可以按一条清晰路线阅读:可识别性先判断目标能否由分布决定;似然比较已观测数据下的参数;统计量与抽样分布描述数据压缩及其重复抽样波动;决策风险再评价从数据到行动的规则。充分性处理压…”
形式陈述 ​
参数化统计模型
是单射,即
对所有
即使完整参数不可识别,目标
此时存在分布泛函
直觉
若两个参数产生完全相同的可观测分布,重复同一种实验只会得到同一个乘积分布,样本量再大也没有区分它们的依据。问题出在实验没有编码所需差异,并非优化器或估计方法不够强;因此可识别性位于一致估计、标准误和区间估计之前。
不可识别常来自冗余坐标、群对称、潜变量缺失或观测通道把不同状态合并。应对方式也要匹配原因:删去冗余坐标、把目标改成等价类、施加有科学含义的约束,或收集能打破对称的新类型观测。任意规定一个标签顺序只能选定表示,不能凭空增加数据证据。
例子与边界
正态模型
两成分混合
在不加约束时具有标签交换:
完整有序三元组不可识别,但混合分布本身以及按标签置换取商后的成分集合仍可能可识别。约束
医学筛查给出更实际的观测机制例子。设患病率为
无论积累多少同类筛查结果,都只识别这个阳性率,不能同时恢复
边界与失败情形 ​
可识别并不表示容易估计。两个分布虽然不同,却可能在总变差、Hellinger 或 Kullback–Leibler 距离上极近;有限样本下它们仍难区分。弱识别描述映射在局部几乎退化的情形,常表现为Fisher 信息接近奇异、似然长而平,或估计分布对小扰动异常敏感。
反过来,不可识别不表示数据毫无信息。若只观测
只检查有限个矩相同通常不足以证明分布相同,也不足以证明不可识别;除非该分布族已知由这些矩唯一决定。某一份数据给两个参数相同的似然值同样不构成不可识别,因为定义比较的是全部可能观测的分布,而非一个样本点上的平局。
结构可识别性是总体分布层面的性质;有限样本的不确定性、后验多峰与优化局部极值是相关但不同的问题。数值算法找不到唯一解可能源自样本噪声或非凸计算,不能单独证明模型不可识别;模型可识别也不能保证优化目标只有一个有限样本极值。
推论与应用
可识别性是一致估计的必要条件。若
潜变量模型、因果模型、矩阵分解和神经网络常带置换、缩放或旋转对称性。实践中应先写出观测等价类,再决定是添加实验信息、施加可辩护的规范化,还是只报告预测分布等可识别目标。随后才有理由研究渐近方差、置信区间和计算误差。
参考资料
- Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,§1.1。
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,§1.5。
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§5.2 与 Ch. 7。