Skip to content

统计模型与参数

Statistical model · Statistical parameter

对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。

领域
统计学
条目类型
定义

形式陈述

(X,A)可观测样本空间,P 是其上的一族概率分布。统计模型可写成三元组

(X,A,P),P={Pθ:θΘ},

其中 Θ 是参数空间,映射 θPθ 给出一种参数化。统计内容首先是集合 P;参数化只是用坐标描述它,既不自动为一一映射,也不自动保证真分布属于其中。观测 X 在某个真实但未知的 PP 下生成,是模型内推断的基本设定。

待推断对象可以是可识别的索引,也可以直接写成分布上的泛函

ψ:PT,

如均值、分位数、生存概率或回归函数。若用 g(θ) 表示目标,必须满足 Pθ=Pθg(θ)=g(θ);否则同一观测分布会被赋予两个不同答案。参数空间可以是有限集、Euclidean 空间、函数空间或概率测度空间,因此“参数”并不等同于“有限维向量”。

一组独立同分布样本 X1,,Xn 对应乘积分布 Pθn。更一般的大样本问题应写成实验序列 {Pθ(n):θΘ};样本量与设计变量属于实验设计,不会因为出现在公式中就变成未知参数。依赖、删失、抽样偏倚或自适应选择都会改变可观测联合律,不能继续用 Pθn 掩盖这些机制。

参数常写成 θ=(ψ,η),其中 ψ 是目标参数、η 是干扰参数。例如 N(μ,σ2) 中若目标是 μ,未知的 σ 仍影响抽样波动。把 σ 从报告目标中排除,不等于把它当作已知;有效保证究竟对每个固定 η、对所有 η,还是只在局部序列上成立,必须由量词说清。

直觉

模型像一张关于“哪些可观测规律仍可能成立”的地图,参数化给地图选取坐标,目标泛函则指定要读取的量。推断程序比较候选分布并控制指定损失下的误差;坐标换了,分布族和科学问题未必改变,误差表达却可能随 Jacobian 或损失尺度改变。

每个模型也都是一组排除性假设。正态位置模型不只声称均值存在,还固定尾部与对称形状;所谓非参数模型放宽分布形状后,仍可能要求独立、共同分布、光滑性或有限矩。模型越大,结论通常越稳健但精度可能越低;模型越小,额外结构能提高精度,也扩大失配风险。

例子与边界

以临床试验的二元疗效为例,单组 Bernoulli 模型取 X={0,1}Θ=[0,1],并令

Pθ(X=x)=θx(1θ)1x.

n 位独立受试者,Pθn(x1:n)=θxi(1θ)nxi。参数 θ 同时是疗效概率与均值;若有治疗组和对照组,模型要扩为 (θ1,θ0),科学目标可以是风险差 θ1θ0 或风险比 θ1/θ0。同一分布族上不同目标会带来不同的边界与损失尺度。

实验室仪器的重复测量常以正态位置—尺度模型作为工作模型:

P={N(μ,σ2):μR, σ>0}.

二维参数 (μ,σ) 决定完整分布;若只关心系统偏移,目标泛函是 ψ(Pμ,σ)=μ,而 σ 仍决定能把偏移估到多准。若仪器偶发重尾误差,正态族可能失配,换成只假定有限方差的模型会改变可用推断,而不只是更换估计算法。

删失数据说明样本空间为何必须从观测机制出发。设潜在故障时间为 T、随访截止时间为 C,实际数据是 (Y,Δ)=(min{T,C},1{TC})。即使给定 T 的生存分布,若不同时说明 C 及其与 T 的关系,就还没有得到 (Y,Δ) 的统计模型。

边界与失败情形

模型与推断规则分属两个层级。声明 XiN(μ,σ2) 只规定候选分布;样本均值、最大似然和 Bayesian 后验是在其上建立的不同规则。算法表现再好,也不能反过来证明候选族包含真实机制。

参数化还可能不可识别。混合模型交换两个成分标签后产生相同分布,原始标签参数便不唯一;数据仍可能识别混合分布或不依赖标签的目标。模型失配是另一条边界:真实分布若不在 P 中,即使参数化单射,估计程序也通常只收敛到某个由准则定义的伪真参数。

共同支配测度也不属于参数,却决定“密度”公式的含义。同一个符号表达在计数测度和 Lebesgue 测度下代表不同分布;潜在完整数据与现实可观测数据更不能共用一个未说明的样本空间。

推论与应用

参数模型通常指 ΘRkk 固定;半参数模型含有限维目标和无限维干扰部分;非参数模型则直接以函数或分布为参数,或允许有效维数随样本增长。这些名称描述候选族的结构,不自行保证某种收敛速度。

接下来的层级可以按一条清晰路线阅读:可识别性先判断目标能否由分布决定;似然比较已观测数据下的参数;统计量与抽样分布描述数据压缩及其重复抽样波动;决策风险再评价从数据到行动的规则。充分性处理压缩是否保留模型信息,不能代替上述任何一个层级。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 1。
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§2.1 与 Ch. 5。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1。
关系图谱46 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例