Skip to content

方法Method

分割似然比与有限样本推断

Split likelihood-ratio test · Universal inference · split LRT

只用训练样本拟合比较密度,在独立检验样本上除以零假设的似然上确界,构造不依赖渐近卡方的检验并核对优化误差方向。

似然比的分子如果专门拟合当前数据,通常会偏大。普通似然比检验要再研究它的零分布;不规则模型下,这个分布可能难以计算。分割似然比换了一个办法:用一部分数据选比较密度,另一部分数据只负责评分。分子在评分之前固定后,密度积分就能给出有限样本保证。

形式陈述 ​

两份数据各做什么 ​

观察来自 Pθ∗ 的 IID 样本。预先把索引拆成训练组 D1 和检验组 D0;或用与数据独立的随机拆分。模型中所有分布相对于共同测度有密度 pθ。只用 D1 得到一个归一化的预测密度 q^,再在 D0=(X1,…,Xn) 上计算似然函数

Q1(D0)=∏i=1nq^(Xi),L0(θ)=∏i=1npθ(Xi).

q^ 可以来自最大似然、正则化或其他算法,甚至不属于原参数族;条件于训练资料,它必须是一份真正积分为一的密度。不能只提供一个未归一化打分函数。

对复合零假设 H0:θ∗∈Θ0,定义

E=Q1(D0)supθ∈Θ0L0(θ).

分母取的是检验组在零模型内能够获得的最高似然。分子在独立资料上选好,分母则允许充分适配当前检验资料;这种不对称是保证成立的关键。分母上确界还须是可测的,实际计算需得到可验证的数值或上界。

在分母为零、分子正时可设 E=∞;两者同为零时设 E=0。若分母为无穷而分子有限,取零。以下均值证明针对真零模型几乎必然有正真似然的观测;在密度值无穷等例外点,可选等价密度版本并按零概率事件处理。

直觉

一条条件积分完成校准 ​

固定真实零参数 θ∗∈Θ0。分母不小于 L0(θ∗),所以

E≤Q1(D0)L0(θ∗).

条件于 D1,q^ 已经固定,检验组仍为来自真模型的独立样本。于是由条件期望和密度积分,

Eθ∗[Q1(D0)L0(θ∗)|D1]=∏i=1n∫{pθ∗>0}q^(x)dμ(x)≤1.

去掉条件后得到 Eθ∗E≤1。每个真零参数都能重复同一证明,故 E 是整个复合零假设的e 值,在 E≥1/α 时拒绝可控制第一类错误。

这里不要求 Fisher 信息非退化,也不要求参数在模型内部;却仍要求独立拆分、正确零模型、归一化预测密度和合法分母。“通用”不表示数据来源与计算误差都可以不管。

例子与边界

八次硬币观测的完整计算 ​

取训练数据 D1=1110,使用训练成功率 q^=3/4。检验数据为 D0=1111,检验 H0:p≤1/2。检验组有四次成功,零模型内的似然 p4 在 p=1/2 达到最大,因此

E=(3/4)4(1/2)4=8116=5.0625.

在 α=0.2 时阈值是五,得到拒绝;在 α=0.05 时阈值是二十,不能拒绝。这个证据完全由训练估计、检验数据与受限优化三个可复算步骤决定。

若检验组为 1100,受限 MLE 仍为 1/2,证据变为

E=(3/4)2(1/4)2(1/2)4=9/16.

若检验组只有一次成功,受限 MLE 为 1/4,不能仍机械地把 1/2 填入分母。对 s 次成功、n 次检验,受限最大点为 min(s/n,1/2);零次成功时用 p=0 并按实际 Bernoulli 概率乘积计算。

为什么分母的优化误差方向很重要 ​

如果精确上确界难算,可以用经过证明的上界 U(D0)≥supΘ0L0(θ)。把分母换成 U 只会减小证据,所以仍有效,代价是功效变保守。

普通优化器找到一个零模型候选 θ~,通常只能保证 L0(θ~)≤supL0。把这个下界当分母会增大证据,方向相反,不能据“优化已经收敛得差不多”保持精确保证。需要上界证书,或保留明确的误差因子并作相应校准。

最小反例只需要一次公平硬币:不拆分而令 q^=X,观察正面便选择总出正面的模型,反面便选择总出反面的模型。分子恒为一,零似然为 1/2,因此 E 恒为二,期望预算立刻失败。这解释了分子为何不能偷看检验资料。

推论与应用

交叉拆分和置信集合 ​

可以交换两组数据的角色,得到 E0←1 与 E1←0,再取平均。两者共享全部数据,通常不独立,但e 值固定平均不需要独立,因而平均仍有效。挑两者最大则需要额外校准。

若要估计整个参数,针对每个候选 θ 定义

Eθ=Q1(D0)/L0(θ),Cα={θ:Eθ<1/α}.

对真参数只需一次均值论证,得到 Pθ∗(θ∗∈Cα)≥1−α。这正是检验反演。由于本页用大于等于阈值拒绝,保留集使用严格小于;改变端点约定时要同步改变检验规则。接受集合不保证是区间、连通或非空。

实现成本与输出 ​

单次执行包含训练算法成本、n 次预测密度评价以及零模型似然上界的计算成本。Bernoulli 例可由一次计数完成,时间 O(n+n1)、额外空间 O(1);一般高维模型的受限优化可能是主要瓶颈,不能统称线性时间。

实际应累计对数密度,将 log⁡Q1−log⁡U 与 log⁡(1/α) 比较,并输出拆分索引或可重现随机种子、训练密度、分母证书、阈值与决定。若训练密度在未来样本点为零,证据为零,这会损失功效却不损坏有效性。

迁移自测。 用独立训练资料拟合一个复杂混合密度,检验样本用于测试单一正态零模型。只要能给零模型最大似然的上界,有限样本证明仍适用;若所有数据都来自同一条有依赖时间序列,普通索引拆分不保证两组独立,本文的条件积分需重新建立。

参考资料
  • Larry Wasserman, Aaditya Ramdas and Sivaraman Balakrishnan, Universal inference, PNAS 117(29), 16880–16890, 2020,arXiv:1912.11436v4 作者稿,§2 的 Theorems 1、3(置信集合与复合零分割检验)、§5 “De-randomization”(多拆分平均)及 §6 “Extensions”中关于零假设最大似然上界的讨论。本文硬币算例和优化方向反例按该构造独立核算。
关系图谱9 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系