似然比的分子如果专门拟合当前数据,通常会偏大。普通似然比检验要再研究它的零分布;不规则模型下,这个分布可能难以计算。分割似然比换了一个办法:用一部分数据选比较密度,另一部分数据只负责评分。分子在评分之前固定后,密度积分就能给出有限样本保证。
形式陈述
两份数据各做什么
观察来自 P θ ∗ 的 IID 样本。预先把索引拆成训练组 D 1 和检验组 D 0 ;或用与数据独立的随机拆分。模型中所有分布相对于共同测度有密度 p θ 。只用 D 1 得到一个归一化的预测密度 q ^ ,再在 D 0 = ( X 1 , … , X n ) 上计算似然函数 理路 似然函数 Likelihood function 固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。
Q 1 ( D 0 ) = ∏ i = 1 n q ^ ( X i ) , L 0 ( θ ) = ∏ i = 1 n p θ ( X i ) . q ^ 可以来自最大似然、正则化或其他算法,甚至不属于原参数族;条件于训练资料,它必须是一份真正积分为一的密度。不能只提供一个未归一化打分函数。
对复合零假设 H 0 : θ ∗ ∈ Θ 0 ,定义
E = Q 1 ( D 0 ) sup θ ∈ Θ 0 L 0 ( θ ) . 分母取的是检验组 在零模型内能够获得的最高似然。分子在独立资料上选好,分母则允许充分适配当前检验资料;这种不对称是保证成立的关键。分母上确界还须是可测的,实际计算需得到可验证的数值或上界。
在分母为零、分子正时可设 E = ∞ ;两者同为零时设 E = 0 。若分母为无穷而分子有限,取零。以下均值证明针对真零模型几乎必然有正真似然的观测;在密度值无穷等例外点,可选等价密度版本并按零概率事件处理。
直觉
一条条件积分完成校准
固定真实零参数 θ ∗ ∈ Θ 0 。分母不小于 L 0 ( θ ∗ ) ,所以
E ≤ Q 1 ( D 0 ) L 0 ( θ ∗ ) . 条件于 D 1 ,q ^ 已经固定,检验组仍为来自真模型的独立样本。于是由条件期望 理路 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 和密度积分,
E θ ∗ [ Q 1 ( D 0 ) L 0 ( θ ∗ ) | D 1 ] = ∏ i = 1 n ∫ { p θ ∗ > 0 } q ^ ( x ) d μ ( x ) ≤ 1. 去掉条件后得到 E θ ∗ E ≤ 1 。每个真零参数都能重复同一证明,故 E 是整个复合零假设的e 值 理路 静态 e 值与期望证据 e-value · e-variable · E-value · 期望证据 以每个零假设分布下的均值不超过一校准非负证据,构造似然比及复合均值检验,并区分静态保证与可选停止。 ,在 E ≥ 1 / α 时拒绝可控制第一类错误。
这里不要求 Fisher 信息非退化,也不要求参数在模型内部;却仍要求独立拆分、正确零模型、归一化预测密度和合法分母。“通用”不表示数据来源与计算误差都可以不管。
例子与边界
八次硬币观测的完整计算
取训练数据 D 1 = 1110 ,使用训练成功率 q ^ = 3 / 4 。检验数据为 D 0 = 1111 ,检验 H 0 : p ≤ 1 / 2 。检验组有四次成功,零模型内的似然 p 4 在 p = 1 / 2 达到最大,因此
E = ( 3 / 4 ) 4 ( 1 / 2 ) 4 = 81 16 = 5.0625 . 在 α = 0.2 时阈值是五,得到拒绝;在 α = 0.05 时阈值是二十,不能拒绝。这个证据完全由训练估计、检验数据与受限优化三个可复算步骤决定。
若检验组为 1100 ,受限 MLE 仍为 1 / 2 ,证据变为
E = ( 3 / 4 ) 2 ( 1 / 4 ) 2 ( 1 / 2 ) 4 = 9 / 16. 若检验组只有一次成功,受限 MLE 为 1 / 4 ,不能仍机械地把 1 / 2 填入分母。对 s 次成功、n 次检验,受限最大点为 min ( s / n , 1 / 2 ) ;零次成功时用 p = 0 并按实际 Bernoulli 概率乘积计算。
为什么分母的优化误差方向很重要
如果精确上确界难算,可以用经过证明的上界 U ( D 0 ) ≥ sup Θ 0 L 0 ( θ ) 。把分母换成 U 只会减小证据,所以仍有效,代价是功效变保守。
普通优化器找到一个零模型候选 θ ~ ,通常只能保证 L 0 ( θ ~ ) ≤ sup L 0 。把这个下界 当分母会增大证据,方向相反,不能据“优化已经收敛得差不多”保持精确保证。需要上界证书,或保留明确的误差因子并作相应校准。
最小反例只需要一次公平硬币:不拆分而令 q ^ = X ,观察正面便选择总出正面的模型,反面便选择总出反面的模型。分子恒为一,零似然为 1 / 2 ,因此 E 恒为二,期望预算立刻失败。这解释了分子为何不能偷看检验资料。
推论与应用
交叉拆分和置信集合
可以交换两组数据的角色,得到 E 0 ← 1 与 E 1 ← 0 ,再取平均。两者共享全部数据,通常不独立,但e 值固定平均 理路 e 值的平均、乘积与选择 Merging e-values · e-merging function · Combining e-values 按同一零假设核对每份证据,证明任意依赖下的固定平均与条件有效乘积,给出最大值、重复证据和数据依赖权重的反例。 不需要独立,因而平均仍有效。挑两者最大则需要额外校准。
若要估计整个参数,针对每个候选 θ 定义
E θ = Q 1 ( D 0 ) / L 0 ( θ ) , C α = { θ : E θ < 1 / α } . 对真参数只需一次均值论证,得到 P θ ∗ ( θ ∗ ∈ C α ) ≥ 1 − α 。这正是检验反演 理路 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 。由于本页用大于等于阈值拒绝,保留集使用严格小于;改变端点约定时要同步改变检验规则。接受集合不保证是区间、连通或非空。
实现成本与输出
单次执行包含训练算法成本、n 次预测密度评价以及零模型似然上界的计算成本。Bernoulli 例可由一次计数完成,时间 O ( n + n 1 ) 、额外空间 O ( 1 ) ;一般高维模型的受限优化可能是主要瓶颈,不能统称线性时间。
实际应累计对数密度,将 log Q 1 − log U 与 log ( 1 / α ) 比较,并输出拆分索引或可重现随机种子、训练密度、分母证书、阈值与决定。若训练密度在未来样本点为零,证据为零,这会损失功效却不损坏有效性。
迁移自测。 用独立训练资料拟合一个复杂混合密度,检验样本用于测试单一正态零模型。只要能给零模型最大似然的上界,有限样本证明仍适用;若所有数据都来自同一条有依赖时间序列,普通索引拆分不保证两组独立,本文的条件积分需重新建立。
参考资料
Larry Wasserman, Aaditya Ramdas and Sivaraman Balakrishnan, Universal inference , PNAS 117(29), 16880–16890, 2020,arXiv:1912.11436v4 作者稿,§2 的 Theorems 1、3(置信集合与复合零分割检验)、§5 “De-randomization”(多拆分平均)及 §6 “Extensions”中关于零假设最大似然上界的讨论。本文硬币算例和优化方向反例按该构造独立核算。