Skip to content

统计模型与参数

Statistical model · Statistical parameter

由参数索引的概率分布族,以及从该分布族提取待推断目标的参数化结构。

形式陈述

(X,A) 是样本空间,P 是其上的一族概率分布。统计模型是三元组

(X,A,P),P={Pθ:θΘ},

其中 Θ 是参数空间,映射 θPθ 给出一种参数化。观测 X 在真实但未知的 PP 下生成;数据已知,分布或其参数未知。

待推断对象可以是索引 θ,也可以是分布的泛函

ψ:PT,

如均值、分位数或回归函数。只有当 Pθ=Pθ 蕴含 ψ(Pθ)=ψ(Pθ) 时,目标才由观测分布良好定义。参数空间可为有限集、Euclidean 空间、函数空间或概率测度空间;“参数”不等于“有限维向量”。

独立同分布样本 X1,,Xn 对应乘积分布 Pθn。样本量 n 是实验设计的一部分,并不自动属于未知参数。若观测存在依赖、删失或自适应选择,联合律必须直接写出,不能仍用 Pθn 代替。

参数还可分为目标参数与干扰参数。例如 N(μ,σ2) 中若目标是 μ,未知的 σ 仍属于模型并影响抽样波动,只是最终报告不以它为中心。把干扰参数从目标中排除,不等于在概率计算中把它当作已知;有效保证通常必须对所有允许的 σ 同时成立,或明确采用点态、局部或渐近量词。

直觉

模型划定数据生成机制的候选范围,参数化则给每个候选分布贴标签。统计推断不是从数据中“读出真相”,而是在这组候选之间比较证据,并对指定目标控制误差。不同参数化可以描述同一组分布,因此分布族是统计内容,坐标标签是表达方式。

模型同时包含假设。正态位置模型假设的不只是存在均值,还固定了分布形状;非参数模型放宽形状,却仍可能假定独立、共同分布或有限矩。结论的有效范围由这些假设决定。

例子与计算

Bernoulli 模型取 X={0,1}Θ=[0,1],并令

Pθ(X=x)=θx(1θ)1x.

n 次独立观测,Pθn(x1,,xn)=θxi(1θ)nxi。参数 θ 同时是成功概率与均值,目标也可改为 ψ(θ)=θ(1θ) 以推断方差。

正态位置—尺度模型为

P={N(μ,σ2):μR, σ>0}.

二维参数 (μ,σ) 决定完整分布;若只关心中位数,目标泛函仍是 ψ(Pμ,σ)=μ,无需把另一个参数假装成已知。

边界与失败情形

模型不是估计算法。声明 XiN(μ,σ2) 只规定候选分布;样本均值、最大似然或 Bayesian 后验是建立在模型上的不同推断规则。把算法输出写进模型定义会混淆假设与决策。

参数可能不可识别。混合模型交换两个成分标签后产生相同分布,故原始标签参数不是唯一的;数据仍可识别混合分布或不依赖标签的目标。模型失配是另一问题:若真实分布根本不在 P 中,即使参数化可识别,也只能讨论伪真参数或稳健性。

样本空间也不能省略。同一个公式在计数测度与 Lebesgue 测度下含义不同,删失数据的可观测空间更不等于潜在完整数据空间。模型必须对应实际能看到的随机对象。

推论与应用

参数模型通常指 ΘRkk 固定;半参数模型同时含有限维目标与无限维干扰部分;非参数模型允许维数随样本增长或直接以函数、分布为参数。这些名称描述模型复杂度,不直接保证某种收敛速度。

似然、充分统计量、检验与决策风险都先量化“对每个 θ”或“对每个 PP”。明确模型与目标,才能判断一致性、可识别性以及误差保证究竟覆盖哪些数据生成机制。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 1。
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 2。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1。