Skip to content

定理Theorem

D最优设计与G最优等价定理

D-optimal design · G-optimal design · Kiefer–Wolfowitz equivalence theorem · D最优实验设计

在有限候选线性实验中,以逐点预测方差认证最大信息行列式,并说明支持、效率、换坐标与整数分配的边界。

一台仪器可以在几个位置反复测量,同样做一百次,全部挤在中间和分到两端,能学到的斜率很不一样。最优设计在数据产生之前选择测量位置及比例。D准则想把整组参数的不确定性椭球压小,G准则想保护最难预测的位置;在本页的连续比例模型中,两者竟由同一张逐点检查表认证。

形式陈述 ​

先说明哪些东西可以选择 ​

给定有限个已知列向量 a1,…,am∈Rp,p≥1,假设它们张成 Rp。选择实验 i 就观察

(1)Y=aiTβ+ε,Eε=0,Var(ε)=σ2>0.

所有重复测量的误差互不相关且同方差;β 未知,候选向量在观察响应前已经固定。这是线性回归模型,但这里允许设计者选择各类行出现多少次。正态分布不是以下协方差比较的必要条件。

近似设计是概率向量 w∈Δm,即 wi≥0、∑iwi=1。这里“近似”表示允许任意实数比例,不表示后面的定理只近似成立。其归一化信息矩阵为

(2)M(w)=∑i=1mwiaiaiT.

它是半正定矩阵;当且仅当正权位置的 ai 张成全空间时正定。确实,vTM(w)v=∑iwi(aiTv)2,为零恰好意味着 v 垂直于全部正权向量。

若实际做 N 次实验,还须有 ni=Nwi∈Z≥0。把这些行排成 X,有 XTX=NM(w);满秩时最小二乘协方差为 σ2M(w)−1/N。因此应先区分连续比例 w 的问题与给定预算 N 的整数次数问题。

三种最优性说的是同一件事 ​

D最优设计最大化 det⁡M(w)。因存在正定设计,最优值严格为正;在概率单纯形上连续的行列式取到最大值,所以所有D最优信息矩阵都正定。

对任意正定设计定义位置 i 的敏感度

(3)di(w)=aiTM(w)−1ai,dmax(w)=maxidi(w).

若在那里预测均值 aiTβ,其最优线性无偏估计的方差是 σ2di(w)/N。G最优设计在正定设计中最小化 dmax;奇异设计记为目标 +∞,因为候选向量张成全空间,至少一个候选均值无法从该设计线性无偏估计。

有限候选Kiefer–Wolfowitz等价定理。 对任意正定设计 w,以下三项等价:

  1. w 是D最优设计
  2. 每个候选位置都有 di(w)≤p
  3. w 是G最优设计,且最优值为 dmax(w)=p

只要这些条件成立,正权位置必满足 di(w)=p。逆命题要小心:只检查正权位置等于 p 不够,还要检查所有被遗漏的位置是否超过 p。

直觉

方差预算为什么恰好是参数个数 ​

将敏感度按当前实验比例平均,利用迹的线性性,得到

(4)∑iwidi(w)=tr(M(w)−1∑iwiaiaiT)=trIp=p.

所以最大敏感度不可能低于 p。如果所有位置都不超过 p,这个下界已经达到;而正权平均等于 p,也迫使每个正权位置都恰好等于 p。这不是要求所有实验“看起来一样”,而是要求它们在当前信息尺度下没有被特别忽视的方向。

从一个新位置的微小投入读出导数 ​

把原设计的一小部分预算移给位置 i:w(t)=(1−t)w+tei,0≤t<1。记 M=M(w)、v=M−1/2ai,则

M−1/2M(w(t))M−1/2=(1−t)I+tvvT.

沿 v 的方向,特征值为 1−t+t‖v‖2;其余方向为 1−t。v=0 时全部为 1−t,下式仍成立。行列式的乘法性给

(5)det⁡M(w(t))det⁡M=(1−t)p−1[1+t(di(w)−1)].

在 t=0 求对数导数,正好得到 di(w)−p。如果某个位置超过 p,往那里移动足够小的预算就能严格增大行列式;所以D最优必满足第二项。这也解释“敏感度”的名字:它测量该位置对目标的一阶改进潜力。

为什么逐点条件能管住所有其他设计 ​

还要证明没有正导数真的意味着全局最优。令 M、B 都正定,将 M−1/2BM−1/2 的正特征值记为 λ1,…,λp。由 log⁡x≤x−1,

(6)log⁡det⁡B−log⁡det⁡M=∑j=1plog⁡λj≤∑j=1p(λj−1)=tr(M−1B)−p.

这正是负对数行列式作为凸函数的一阶支撑界,符号反过来后成为最大化对数行列式的全局上界。这里给出了谱证明,不需要把“局部最优就是全局最优”作为未经检查的口号。

取 B=M(u),若全部 di(w)≤p,则式(6)右边为 ∑iuidi(w)−p≤0。奇异 B 的行列式为零,也不会更好。于是第二项推出D最优。

D最优设计已由紧性保证存在,又已经证明它满足 dmax=p。结合式(4)对所有正定设计给出的下界,G最优值就是 p;任何G最优设计也必须满足第二项。三个方向至此都已证明。

例子与边界

直线回归:中点测量为什么不能代替两端 ​

取三个候选位置 x=−1,0,1,向量 a(x)=(1,x)T。端点各分一半、中心不分配,给

(7)w∗=(1/2,0,1/2),M(w∗)=I2,d(x;w∗)=1+x2.

三个敏感度为 2,1,2,全部不超过 p=2,所以这就是D与G共同最优设计。中心位置的敏感度严格较低,因此最优设计不能给它正权。

若三个位置均分,M=diag(1,2/3),敏感度变成 5/2,1,5/2。中心重复测量也能帮助估截距,却不提供斜率方向的信息;均分因此没有充分利用固定预算。该设计的行列式是 2/3,而端点设计为 1。

更容易误判的是只在 x=0,1 各放一半。当前支持的两个敏感度都等于 2,但遗漏位置 x=−1 的敏感度为 10。检查表必须覆盖全部候选,而不是只核验已经选中的行。

信息矩阵唯一,实验标签的权重未必唯一 ​

对数行列式在正定矩阵上严格凹:沿 Mt=(1−t)M+tB,二阶导数为

(8)d2dt2log⁡det⁡Mt=−tr[(Mt−1/2(B−M)Mt−1/2)2],

若 B≠M 就严格为负。可由在任一 t 处对称相对扰动的特征值展开 ∑jlog⁡(1+hλj) 得到此式。因此两个不同的正定信息矩阵不可能同时最优:它们的中点会更好。

但是映射 w↦M(w) 未必一一。如果两个实验标签的向量相同,最优总权重可以在它们之间任意分拆,信息不变。即使向量不同,也可能有 aiaiT=ajajT,例如 aj=−ai。唯一的是最优信息矩阵,不是标签列表。

整数次数不能直接套连续方向判据 ​

只有 ni=Nwi 都为非负整数时,比例才能原样执行。连续路径 (1−t)w+tei 通常不在给定 N 的整数网格上,所以“存在一个很小的改进方向”不能否定整数最优性。

最简单的例子取两个候选 a1=(1,0)T、a2=(0,1)T,预算 N=3。满秩次数只有 (1,2) 和 (2,1),均为整数D最优;其最大敏感度为 3>p=2。连续最优比例 (1/2,1/2) 无法用三次测量精确实现。

一般整数问题中,D最优与G最优甚至可能分开。完整终点在四个候选、五次测量中枚举全部次数,给出两者不同的最优解;不能只把连续解四舍五入后宣称已证整数最优。

模型变了,信息公式也要重写 ​

若误差独立正态且方差已知,单次实验的得分为 ai(Y−aiTβ)/σ2,其外积期望为 aiaiT/σ2。独立信息相加,整份实验的Fisher信息就是 NM(w)/σ2。没有指定密度时,式(2)仍控制线性无偏估计的协方差,但不要因此虚构一份Fisher信息模型。

已知位置方差为 σi2 时,可以先把响应和向量都除以 σi,再对标准化向量设计。若噪声相关、方差依赖未知参数、每种实验费用不同,或者还有最少次数等约束,本页的可行域或信息矩阵都会改变,需要另写判据。

推论与应用

没有达到最优也能给出可核验的界 ​

对任意正定候选 w,计算 D=dmax(w)≥p。式(6)立即给

(9)0≤log⁡det⁡M∗−log⁡det⁡M(w)≤D−p.

还可直接控制常用的D效率

(10)EffD(w)=(det⁡M(w)det⁡M∗)1/p≥pD.

证明是对 M(w)−1/2M∗M(w)−1/2 的正特征值用算术—几何平均:其迹为 ∑iw∗,idi(w)≤D,所以其行列式的 p 次根不超过 D/p。这份界由当前矩阵和全部候选向量给出,不要求知道最优权重。

若 p>1 且某点敏感度 d>p,式(5)的一维行列式沿该方向在

(11)t∗=d−pp(d−1)∈(0,1)

取到最大值。对式(5)求对数导数即可解出该步长。p=1 时行列式本来就是权重的线性函数,直接选择最大的 ai2 即可,不必套式(11)的内部步公式。这提供一个实际改进步骤;本页不据此宣称任意停止规则或浮点实现都有全局收敛保证。停止证书仍应计算所有敏感度及式(9)–(10)。

为什么总有一个支持不太大的最优设计 ​

实对称 p×p 矩阵空间维数为 q=p(p+1)/2。在最优矩阵 M∗ 处,所有正权的原子 aiaiT 都落在仿射超平面

tr(M∗−1S)=p

内,其维数至多 q−1。对这些原子的凸组合应用Carathéodory定理,就能用至多 q 个候选表示同一个 M∗。这比对整个矩阵空间直接给出的 q+1 少一个;减少来自最优性暴露的超平面。它是存在性上界,不是说每份最优权重都只有这么多非零项,也不保证压缩后恰好满足整数预算。

换坐标与换目标是两回事 ​

用可逆矩阵 T 改写向量 a~i=Tai,参数改为 β~=T−Tβ。于是 M~=TMTT、det⁡M~=(det⁡T)2det⁡M,而全部敏感度不变。D和G最优权重因此不依赖这种可逆参数坐标变换。

若真正关心的只有一个线性量 cTβ,则Elfving的c最优设计优化的是这个量的方差。在上述直线模型中,预测 β0+2β1 时,D最优端点均分给归一化方差 5,而端点比例 1/4,3/4 给 4。这是目标改变后最优分配改变,不是坐标变换破坏了等价定理。

计算时可用稳定的Cholesky或QR/SVD解线性系统求 di,避免显式形成病态逆矩阵。稠密构造 M、分解及全部二次型通常需 O(mp2+p3) 次算术工作;浮点近似的可行性和舍入误差须另行控制。公开有理数程序采用精确消元,核验本页和终点的小规模证书;它的有限枚举不替代上面的一般证明。

参考资料
关系图谱19 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系