Skip to content

定理Theorem

Elfving定理与c最优设计

Elfving theorem · c-optimal design · Elfving set · c最优实验设计

将一个可估线性目标的最小方差设计化为最小一范数表示、对偶支撑证书和对称凸包的射线交点,允许最优信息矩阵奇异。

如果实验只为估计“某个指定位置的平均响应”,把所有回归系数都估得很准可能是在浪费预算。c最优设计先固定真正需要的线性量,再决定测量比例。Elfving定理把这件事画成一个几何问题:把实验向量及其负向量围成凸包,看目标方向能伸到多远。边界上的凸组合,恰好给出最优次数比例。

形式陈述 ​

目标能否估计,要在求逆之前判断 ​

给定有限实验向量 a1,…,am∈Rp,假设它们张成全空间。沿用同方差、不相关误差的线性模型:在位置 i 重复观察 Y=aiTβ+ε,Eε=0、Var(ε)=σ2>0。本页只关心预先指定的目标 cTβ,其中 c≠0。

设计权重满足 wi≥0、∑iwi=1。实际做 N 次时须有整数 ni=Nwi;暂时先放松这个整数条件。对 wi>0 的位置,记样本平均为 Y¯i。线性估计量 ∑ibiY¯i 对所有 β 无偏,当且仅当

(1)∑ibiai=c.

没有测量的位置不能使用,所以 wi=0 时必须 bi=0。在整数次数可执行时,该估计量的方差为

(2)σ2N∑i:wi>0bi2wi.

因此定义归一化最佳线性无偏方差

(3)Vc(w)=min∑ibiai=cbi=0 若 wi=0∑i:wi>0bi2wi,

若约束不可行,定义 Vc(w)=+∞。这比先写一个逆矩阵更稳妥:信息矩阵 M(w)=∑iwiaiaiT 可以奇异,但目标仍可能可估。

c最优设计在整个概率单纯形上最小化 Vc(w)。最优性只在线性无偏估计量类中比较;它不声称击败所有有偏估计,也不自带有限样本正态区间。

同一个最优值的三种表示 ​

令 A=[a1 ⋯ am],并定义

(4)s=minAb=c‖b‖1,E=conv{a1,−a1,…,am,−am},ρ=max{t≥0:tc∈E}.

这里 E 是实验向量的对称凸包,称为Elfving集。张成假设使原点位于它的内部;c≠0 使 0<ρ<∞,且 s>0。定理给出

(5)minwVc(w)=s2=ρ−2.

若 b∗ 达到最小一范数,令

(6)wi∗=|b∗,i|s.

这就得到一个c最优设计。等价的几何陈述是:w 最优,当且仅当可以选择正权位置的符号 ϵi∈{−1,1},使

(7)ρc=∑iwiϵiai∈∂E.

零权位置的符号任选。这里的 ρ 是目标正向射线的最远交点,不是任意边界点的长度;对称性同时允许负系数估计量,不能只画 conv{ai}。

直觉

先选估计系数,再把实验次数配给它 ​

固定一份无偏系数 b。由Cauchy–Schwarz不等式,

(8)(∑i|bi|)2=(∑i:wi>0|bi|wiwi)2≤∑i:wi>0bi2wi.

取 wi=|bi|/‖b‖1 时等号成立。也就是说,一个位置的估计系数绝对值越大,就应给它越多重复测量,刚好按绝对值比例分配。

对所有 Ab=c 再取最小,得到 minwVc(w)=s2。最小一范数解确实存在:约束非空,任取可行 b0,只需在闭且有界的集合 {b:Ab=c, ‖b‖1≤‖b0‖1} 中最小化连续函数。式(6)于是也证明最优设计存在,不必假设最优矩阵可逆。

一范数为什么变成凸包里的半径 ​

任意 Ab=c 都给

c‖b‖1=∑i|bi|‖b‖1sign(bi)ai∈E.

因此 1/s≤ρ。反过来,若 tc∈E,把它写成带非负权重、权重和一的正负实验向量组合,按同一标签合并系数并除以 t>0,就得到 Ab=c 且 ‖b‖1≤1/t。取 t=ρ,得 s≤1/ρ,即 ρ≤1/s。两边合起来给 s=1/ρ。

若 w 已最优,固定它的式(3)最小值能取到:在正权坐标上目标是正定二次型,限制到非空闭仿射空间后有最小点。取相应 b,式(8)及 ‖b‖1≥s 的两道不等式必须同时取等,因此 |bi|=swi,给出式(7)。反过来,式(7)令 bi=wiϵi/ρ,就得到无偏估计量及方差 ρ−2,故 w 最优。这补全了“当且仅当”,不只是从某个最优系数构造一份设计。

对偶向量是一把所有实验都不能越过的尺 ​

把 b=b+−b−、b+,b−≥0,最小一范数问题等价于

min∑i(bi++bi−)s.t.A(b+−b−)=c,b+,b−≥0.

由线性规划强对偶,其对偶为

(9)s=maxzcTzs.t.|aiTz|≤1(i=1,…,m).

原问题可行且最优有限,所以两侧都取到最优值。也可直接看出对偶可行集紧:张成假设排除了所有能无限增长而不改变 ATz 的方向。

任意可行的 b,z 都满足

(10)cTz=∑ibiaiTz≤∑i|bi|.

因此只要交付 Ab=c、|ATz|≤1 以及 cTz=‖b‖1>0,无需知道求解算法,就能认证 b、式(6)的权重及最优方差。这份等号还迫使

(11)bi≠0⟹aiTz=sign(bi).

在几何图中,zTx=1 正是经过 ρc 的支撑超平面;所有真正使用的有符号实验向量都贴在这个平面上。

例子与边界

外推到两倍位置:为什么左端出现负系数 ​

候选仍取 x=−1,0,1、a(x)=(1,x)T。要估计 β0+tβ1,令 c=(1,t)T、t>1。无偏系数可取

(12)b−=(1−t)/2,b0=0,b+=(1+t)/2.

它们满足 b−a(−1)+b+a(1)=c,一范数为 t。对偶向量 z=(0,1)T 在三个位置的内积为 −1,0,1,全部合法,且 cTz=t。于是证书闭合:

(13)w−∗=t−12t,w0∗=0,w+∗=t+12t,Vc(w∗)=t2.

左端系数为负是为了向右外推;测量次数始终非负。取 t=2,四次实验即可按一次左端、三次右端执行,估计量为 −Y¯−/2+3Y¯+/2,方差为 4σ2/N。

此时Elfving集是方形 [−1,1]2。正向射线上的最远点为 ρc=(1/2,1),ρ=1/2,而

(1/2,1)=14[−a(−1)]+34a(1).

几何权重正是测量比例。D最优设计把左右端均分,信息矩阵为 I2,这个目标的方差却是 1+22=5;c最优专门照顾目标,因此降到 4。

全部系数不可识别,目标仍可能估得最好 ​

若只想估截距,c=(1,0)T,把全部预算放在 x=0 就有 b0=1、Vc=1。对偶取 z=(1,0)T,三个候选内积都为一,认证最优。

该设计的 M=diag(1,0) 奇异,斜率完全不能识别,但截距恰好就是中心的均值。左右端均分也能给截距方差一,说明最优权重和最优信息矩阵都可能不唯一。D最优信息矩阵的唯一性不能移植到c准则。

如果在同一中心-only设计下改估斜率 c=(0,1)T,式(1)无解,正确值是 +∞。盲目代入 cTM+c 却得到零,因为 M+=diag(1,0);这个零只是伪逆把不可见方向送到零,并不是零方差的估计器。

对称凸包和全部候选都不可省略 ​

外推例的 c 必须用正负系数表示。只用 conv{ai},所有点第一坐标都是一,射线与该集合可能根本不交,便丢失了合法无偏估计。负的估计系数不等于负的实验概率。

对偶可行性也须检查全部候选。若只在已选位置有 |aiTz|≤1,遗漏位置可能越界并提供更便宜的一范数表示,现有下界就没有依据。数值求解器输出很小的原始—对偶目标差,也不能替代这两侧的可行性检查。

若所有 ai 只张成子空间 S,先判断 c∈S。在其中时可换到 S 的坐标,整个定理使用 dim⁡S;不在其中时任何设计都不可估,ρ=0。c=0 则是另一个简单边界:恒零估计的方差为零,任意设计都最优,无需使用 s>0 的比例公式。

推论与应用

可估时怎样回到熟悉的矩阵表达式 ​

对一个固定设计,rangeM(w) 恰是正权实验向量的张成空间。因而可估性等价于存在 u 满足 M(w)u=c。此时令

bi∗=wiaiTu.

有 Ab∗=M(w)u=c。任意其他可行系数写成 b=b∗+h,则 ∑ihiai=0;展开式(3)中的平方,交叉项为 2∑ihiaiTu=0,所以

(14)∑i:wi>0bi2wi=cTu+∑i:wi>0hi2wi.

于是 Vc(w)=cTu,而且不依赖满足 Mu=c 的解选哪一个。满秩时 u=M−1c;奇异但可估时可取 u=M+c。式(14)同时证明最优线性无偏性,说明伪逆公式的使用前提在哪里。

一份下界与一份可执行上界 ​

任取满足 |ATz|≤1 的 z,由对称性可换号使 cTz≥0。对任意设计和可用的无偏系数 b,式(8)–(10)给

(15)(cTz)2≤minuVc(u)≤Vc(w)≤∑i:wi>0bi2wi.

这是一份实际可以交付的方差区间。下界平方时不能省略非负或绝对值的说明;对任意符号的可行 z,也可以先写 |cTz|≤s 再平方。

对给定整数预算,连续最优值仍是下界,而任何满足 Nwi∈Z 的无偏设计给上界。两界相等便认证整数最优;不相等时还须比较整数候选。最优比例的独立四舍五入可能让次数总和错误,甚至删去使目标可估的关键位置。

最优设计可只用至多p个位置 ​

取对偶最优 z。式(11)使 ρc 的所有有符号支持点落在 zTx=1 的面上,其仿射维数至多 p−1。对这个面使用Carathéodory定理,可用至多 p 个有符号实验向量表示 ρc,从而构造至多 p 个位置的最优设计。同一位置的正负向量不可能同时落在该面上,因为其内积互为相反数。这个结论允许信息矩阵秩亏,不要求这 p 个向量恰好独立。

坐标、尺度与实际误差预算 ​

若 a~i=Tai、β~=T−Tβ,为了保留同一个目标,还必须取 c~=Tc。于是 A~b=c~ 与原约束等价,最优权重、s 和归一化方差都不变。只变实验向量却忘记变 c,是在解另一个问题。

若把目标改为 λc,λ≠0,最佳方差乘 λ2,最优权重集合不变。噪声共同尺度与总次数最后按式(2)乘回 σ2/N。预测一个独立新观测还要加上它自身的噪声方差,不能把这里对均值的最小方差直接当作整个预测误差。

终点练习用非轴向实验给出不同最优支持、整数次数和奇异可估证书。公开程序用精确线性代数枚举小规模原始基本解与对偶顶点,再交叉核验式(14);它不把浮点近似相等视作数学证明,也不宣称适合大规模求解。

参考资料
关系图谱19 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系