一台仪器可以在几个位置反复测量,同样做一百次,全部挤在中间和分到两端,能学到的斜率很不一样。最优设计在数据产生之前选择测量位置及比例。D准则想把整组参数的不确定性椭球压小,G准则想保护最难预测的位置;在本页的连续比例模型中,两者竟由同一张逐点检查表认证。
形式陈述
先说明哪些东西可以选择
给定有限个已知列向量 a 1 , … , a m ∈ R p ,p ≥ 1 ,假设它们张成 R p 。选择实验 i 就观察
(1) Y = a i T β + ε , E ε = 0 , Var ( ε ) = σ 2 > 0. 所有重复测量的误差互不相关且同方差;β 未知,候选向量在观察响应前已经固定。这是线性回归模型 理路 线性回归统计模型 Linear regression model · Linear model 响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。 ,但这里允许设计者选择各类行出现多少次。正态分布不是以下协方差比较的必要条件。
近似设计 是概率向量 w ∈ Δ m ,即 w i ≥ 0 、∑ i w i = 1 。这里“近似”表示允许任意实数比例,不表示后面的定理只近似成立。其归一化信息矩阵为
(2) M ( w ) = ∑ i = 1 m w i a i a i T . 它是半正定矩阵 理路 正定与半正定矩阵 Positive definite matrix · Positive semidefinite matrix · PSD matrix 由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。 ;当且仅当正权位置的 a i 张成全空间时正定。确实,v T M ( w ) v = ∑ i w i ( a i T v ) 2 ,为零恰好意味着 v 垂直于全部正权向量。
若实际做 N 次实验,还须有 n i = N w i ∈ Z ≥ 0 。把这些行排成 X ,有 X T X = N M ( w ) ;满秩时最小二乘协方差为 σ 2 M ( w ) − 1 / N 。因此应先区分连续比例 w 的问题与给定预算 N 的整数次数问题。
三种最优性说的是同一件事
D最优设计最大化 det M ( w ) 。因存在正定设计,最优值严格为正;在概率单纯形上连续的行列式 理路 行列式 Determinant 交换含幺环上方阵的交替多线性标量不变量。 取到最大值,所以所有D最优信息矩阵都正定。
对任意正定设计定义位置 i 的敏感度
(3) d i ( w ) = a i T M ( w ) − 1 a i , d max ( w ) = max i d i ( w ) . 若在那里预测均值 a i T β ,其最优线性无偏估计的方差是 σ 2 d i ( w ) / N 。G最优设计在正定设计中最小化 d max ;奇异设计记为目标 + ∞ ,因为候选向量张成全空间,至少一个候选均值无法从该设计线性无偏估计。
有限候选Kiefer–Wolfowitz等价定理。 对任意正定设计 w ,以下三项等价:
w 是D最优设计
每个候选位置都有 d i ( w ) ≤ p
w 是G最优设计,且最优值为 d max ( w ) = p
只要这些条件成立,正权位置必满足 d i ( w ) = p 。逆命题要小心:只检查正权位置等于 p 不够,还要检查所有被遗漏的位置是否超过 p 。
直觉
方差预算为什么恰好是参数个数
将敏感度按当前实验比例平均,利用迹的线性性,得到
(4) ∑ i w i d i ( w ) = tr ( M ( w ) − 1 ∑ i w i a i a i T ) = tr I p = p . 所以最大敏感度不可能低于 p 。如果所有位置都不超过 p ,这个下界已经达到;而正权平均等于 p ,也迫使每个正权位置都恰好等于 p 。这不是要求所有实验“看起来一样”,而是要求它们在当前信息尺度下没有被特别忽视的方向。
从一个新位置的微小投入读出导数
把原设计的一小部分预算移给位置 i :w ( t ) = ( 1 − t ) w + t e i ,0 ≤ t < 1 。记 M = M ( w ) 、v = M − 1 / 2 a i ,则
M − 1 / 2 M ( w ( t ) ) M − 1 / 2 = ( 1 − t ) I + t v v T . 沿 v 的方向,特征值为 1 − t + t ‖ v ‖ 2 ;其余方向为 1 − t 。v = 0 时全部为 1 − t ,下式仍成立。行列式的乘法性给
(5) det M ( w ( t ) ) det M = ( 1 − t ) p − 1 [ 1 + t ( d i ( w ) − 1 ) ] . 在 t = 0 求对数导数,正好得到 d i ( w ) − p 。如果某个位置超过 p ,往那里移动足够小的预算就能严格增大行列式;所以D最优必满足第二项。这也解释“敏感度”的名字:它测量该位置对目标的一阶改进潜力。
为什么逐点条件能管住所有其他设计
还要证明没有正导数真的意味着全局最优。令 M 、B 都正定,将 M − 1 / 2 B M − 1 / 2 的正特征值记为 λ 1 , … , λ p 。由 log x ≤ x − 1 ,
(6) log det B − log det M = ∑ j = 1 p log λ j ≤ ∑ j = 1 p ( λ j − 1 ) = tr ( M − 1 B ) − p . 这正是负对数行列式作为凸函数 理路 凸函数 Convex function 函数在任意凸组合处不超过相同权重下函数值的凸组合。 的一阶支撑界,符号反过来后成为最大化对数行列式的全局上界。这里给出了谱证明,不需要把“局部最优就是全局最优”作为未经检查的口号。
取 B = M ( u ) ,若全部 d i ( w ) ≤ p ,则式(6)右边为 ∑ i u i d i ( w ) − p ≤ 0 。奇异 B 的行列式为零,也不会更好。于是第二项推出D最优。
D最优设计已由紧性保证存在,又已经证明它满足 d max = p 。结合式(4)对所有正定设计给出的下界,G最优值就是 p ;任何G最优设计也必须满足第二项。三个方向至此都已证明。
图片加载失败
例子与边界
直线回归:中点测量为什么不能代替两端
取三个候选位置 x = − 1 , 0 , 1 ,向量 a ( x ) = ( 1 , x ) T 。端点各分一半、中心不分配,给
(7) w ∗ = ( 1 / 2 , 0 , 1 / 2 ) , M ( w ∗ ) = I 2 , d ( x ; w ∗ ) = 1 + x 2 . 三个敏感度为 2 , 1 , 2 ,全部不超过 p = 2 ,所以这就是D与G共同最优设计。中心位置的敏感度严格较低,因此最优设计不能给它正权。
若三个位置均分,M = diag ( 1 , 2 / 3 ) ,敏感度变成 5 / 2 , 1 , 5 / 2 。中心重复测量也能帮助估截距,却不提供斜率方向的信息;均分因此没有充分利用固定预算。该设计的行列式是 2 / 3 ,而端点设计为 1 。
更容易误判的是只在 x = 0 , 1 各放一半。当前支持的两个敏感度都等于 2 ,但遗漏位置 x = − 1 的敏感度为 10 。检查表必须覆盖全部候选,而不是只核验已经选中的行。
信息矩阵唯一,实验标签的权重未必唯一
对数行列式在正定矩阵上严格凹:沿 M t = ( 1 − t ) M + t B ,二阶导数为
(8) d 2 d t 2 log det M t = − tr [ ( M t − 1 / 2 ( B − M ) M t − 1 / 2 ) 2 ] , 若 B ≠ M 就严格为负。可由在任一 t 处对称相对扰动的特征值展开 ∑ j log ( 1 + h λ j ) 得到此式。因此两个不同的正定信息矩阵不可能同时最优:它们的中点会更好。
但是映射 w ↦ M ( w ) 未必一一。如果两个实验标签的向量相同,最优总权重可以在它们之间任意分拆,信息不变。即使向量不同,也可能有 a i a i T = a j a j T ,例如 a j = − a i 。唯一的是最优信息矩阵,不是标签列表。
整数次数不能直接套连续方向判据
只有 n i = N w i 都为非负整数时,比例才能原样执行。连续路径 ( 1 − t ) w + t e i 通常不在给定 N 的整数网格上,所以“存在一个很小的改进方向”不能否定整数最优性。
最简单的例子取两个候选 a 1 = ( 1 , 0 ) T 、a 2 = ( 0 , 1 ) T ,预算 N = 3 。满秩次数只有 ( 1 , 2 ) 和 ( 2 , 1 ) ,均为整数D最优;其最大敏感度为 3 > p = 2 。连续最优比例 ( 1 / 2 , 1 / 2 ) 无法用三次测量精确实现。
一般整数问题中,D最优与G最优甚至可能分开。完整终点 在四个候选、五次测量中枚举全部次数,给出两者不同的最优解;不能只把连续解四舍五入后宣称已证整数最优。
模型变了,信息公式也要重写
若误差独立正态且方差已知,单次实验的得分 理路 Score 与 Fisher 信息 Score function · Fisher information 对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。 为 a i ( Y − a i T β ) / σ 2 ,其外积期望为 a i a i T / σ 2 。独立信息相加,整份实验的Fisher信息就是 N M ( w ) / σ 2 。没有指定密度时,式(2)仍控制线性无偏估计的协方差,但不要因此虚构一份Fisher信息模型。
已知位置方差为 σ i 2 时,可以先把响应和向量都除以 σ i ,再对标准化向量设计。若噪声相关、方差依赖未知参数、每种实验费用不同,或者还有最少次数等约束,本页的可行域或信息矩阵都会改变,需要另写判据。
推论与应用
没有达到最优也能给出可核验的界
对任意正定候选 w ,计算 D = d max ( w ) ≥ p 。式(6)立即给
(9) 0 ≤ log det M ∗ − log det M ( w ) ≤ D − p . 还可直接控制常用的D效率
(10) Eff D ( w ) = ( det M ( w ) det M ∗ ) 1 / p ≥ p D . 证明是对 M ( w ) − 1 / 2 M ∗ M ( w ) − 1 / 2 的正特征值用算术—几何平均:其迹为 ∑ i w ∗ , i d i ( w ) ≤ D ,所以其行列式的 p 次根不超过 D / p 。这份界由当前矩阵和全部候选向量给出,不要求知道最优权重。
若 p > 1 且某点敏感度 d > p ,式(5)的一维行列式沿该方向在
(11) t ∗ = d − p p ( d − 1 ) ∈ ( 0 , 1 ) 取到最大值。对式(5)求对数导数即可解出该步长。p = 1 时行列式本来就是权重的线性函数,直接选择最大的 a i 2 即可,不必套式(11)的内部步公式。这提供一个实际改进步骤;本页不据此宣称任意停止规则或浮点实现都有全局收敛保证。停止证书仍应计算所有敏感度及式(9)–(10)。
为什么总有一个支持不太大的最优设计
实对称 p × p 矩阵空间维数为 q = p ( p + 1 ) / 2 。在最优矩阵 M ∗ 处,所有正权的原子 a i a i T 都落在仿射超平面
tr ( M ∗ − 1 S ) = p 内,其维数至多 q − 1 。对这些原子的凸组合应用Carathéodory定理 理路 Carathéodory 定理 Caratheodory theorem in convex geometry 有限维凸包中的每个点都可由至多维数加一个原集合点的凸组合表示。 ,就能用至多 q 个候选表示同一个 M ∗ 。这比对整个矩阵空间直接给出的 q + 1 少一个;减少来自最优性暴露的超平面。它是存在性上界,不是说每份最优权重都只有这么多非零项,也不保证压缩后恰好满足整数预算。
换坐标与换目标是两回事
用可逆矩阵 T 改写向量 a ~ i = T a i ,参数改为 β ~ = T − T β 。于是 M ~ = T M T T 、det M ~ = ( det T ) 2 det M ,而全部敏感度不变。D和G最优权重因此不依赖这种可逆参数坐标变换。
若真正关心的只有一个线性量 c T β ,则Elfving的c最优设计 理路 Elfving定理与c最优设计 Elfving theorem · c-optimal design · Elfving set · c最优实验设计 将一个可估线性目标的最小方差设计化为最小一范数表示、对偶支撑证书和对称凸包的射线交点,允许最优信息矩阵奇异。 优化的是这个量的方差。在上述直线模型中,预测 β 0 + 2 β 1 时,D最优端点均分给归一化方差 5 ,而端点比例 1 / 4 , 3 / 4 给 4 。这是目标改变后最优分配改变,不是坐标变换破坏了等价定理。
计算时可用稳定的Cholesky或QR/SVD解线性系统求 d i ,避免显式形成病态逆矩阵。稠密构造 M 、分解及全部二次型通常需 O ( m p 2 + p 3 ) 次算术工作;浮点近似的可行性和舍入误差须另行控制。公开有理数程序 采用精确消元,核验本页和终点的小规模证书;它的有限枚举不替代上面的一般证明。
参考资料