如果实验只为估计“某个指定位置的平均响应”,把所有回归系数都估得很准可能是在浪费预算。c最优设计先固定真正需要的线性量,再决定测量比例。Elfving定理把这件事画成一个几何问题:把实验向量及其负向量围成凸包,看目标方向能伸到多远。边界上的凸组合,恰好给出最优次数比例。
形式陈述
目标能否估计,要在求逆之前判断
给定有限实验向量 ,假设它们张成全空间。沿用同方差、不相关误差的线性模型理路线性回归统计模型Linear regression model · Linear model响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。:在位置 重复观察 ,、。本页只关心预先指定的目标 ,其中 。
设计权重满足 、。实际做 次时须有整数 ;暂时先放松这个整数条件。对 的位置,记样本平均为 。线性估计量 对所有 无偏,当且仅当
没有测量的位置不能使用,所以 时必须 。在整数次数可执行时,该估计量的方差为
因此定义归一化最佳线性无偏方差
若若约束不可行,定义 。这比先写一个逆矩阵更稳妥:信息矩阵 可以奇异,但目标仍可能可估。
c最优设计在整个概率单纯形上最小化 。最优性只在线性无偏估计量类中比较;它不声称击败所有有偏估计,也不自带有限样本正态区间。
同一个最优值的三种表示
令 ,并定义
这里 是实验向量的对称凸包理路凸包Convex hull包含给定点集的最小凸集,是凸几何中的基本包络对象,并可进一步研究其算法构造。,称为Elfving集。张成假设使原点位于它的内部; 使 ,且 。定理给出
若 达到最小一范数,令
这就得到一个c最优设计。等价的几何陈述是: 最优,当且仅当可以选择正权位置的符号 ,使
零权位置的符号任选。这里的 是目标正向射线的最远交点,不是任意边界点的长度;对称性同时允许负系数估计量,不能只画 。
直觉
先选估计系数,再把实验次数配给它
固定一份无偏系数 。由Cauchy–Schwarz不等式理路Cauchy–Schwarz 不等式Cauchy–Schwarz inequality · 柯西–施瓦茨不等式内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。,
取 时等号成立。也就是说,一个位置的估计系数绝对值越大,就应给它越多重复测量,刚好按绝对值比例分配。
对所有 再取最小,得到 。最小一范数解确实存在:约束非空,任取可行 ,只需在闭且有界的集合 中最小化连续函数。式(6)于是也证明最优设计存在,不必假设最优矩阵可逆。
一范数为什么变成凸包里的半径
任意 都给
因此 。反过来,若 ,把它写成带非负权重、权重和一的正负实验向量组合,按同一标签合并系数并除以 ,就得到 且 。取 ,得 ,即 。两边合起来给 。
若 已最优,固定它的式(3)最小值能取到:在正权坐标上目标是正定二次型,限制到非空闭仿射空间后有最小点。取相应 ,式(8)及 的两道不等式必须同时取等,因此 ,给出式(7)。反过来,式(7)令 ,就得到无偏估计量及方差 ,故 最优。这补全了“当且仅当”,不只是从某个最优系数构造一份设计。
对偶向量是一把所有实验都不能越过的尺
把 、,最小一范数问题等价于
由线性规划强对偶理路线性规划对偶Linear programming duality · LP duality从线性约束生成对偶界,并以弱对偶、强对偶和互补松弛连接两侧最优解。,其对偶为
原问题可行且最优有限,所以两侧都取到最优值。也可直接看出对偶可行集紧:张成假设排除了所有能无限增长而不改变 的方向。
任意可行的 都满足
因此只要交付 、 以及 ,无需知道求解算法,就能认证 、式(6)的权重及最优方差。这份等号还迫使
在几何图中, 正是经过 的支撑超平面;所有真正使用的有符号实验向量都贴在这个平面上。
例子与边界
外推到两倍位置:为什么左端出现负系数
候选仍取 、。要估计 ,令 、。无偏系数可取
它们满足 ,一范数为 。对偶向量 在三个位置的内积为 ,全部合法,且 。于是证书闭合:
左端系数为负是为了向右外推;测量次数始终非负。取 ,四次实验即可按一次左端、三次右端执行,估计量为 ,方差为 。
此时Elfving集是方形 。正向射线上的最远点为 ,,而
几何权重正是测量比例。D最优设计理路D最优设计与G最优等价定理D-optimal design · G-optimal design · Kiefer–Wolfowitz equivalence theorem · D最优实验设计在有限候选线性实验中,以逐点预测方差认证最大信息行列式,并说明支持、效率、换坐标与整数分配的边界。把左右端均分,信息矩阵为 ,这个目标的方差却是 ;c最优专门照顾目标,因此降到 。
全部系数不可识别,目标仍可能估得最好
若只想估截距,,把全部预算放在 就有 、。对偶取 ,三个候选内积都为一,认证最优。
该设计的 奇异,斜率完全不能识别,但截距恰好就是中心的均值。左右端均分也能给截距方差一,说明最优权重和最优信息矩阵都可能不唯一。D最优信息矩阵的唯一性不能移植到c准则。
如果在同一中心-only设计下改估斜率 ,式(1)无解,正确值是 。盲目代入 却得到零,因为 ;这个零只是伪逆把不可见方向送到零,并不是零方差的估计器。
对称凸包和全部候选都不可省略
外推例的 必须用正负系数表示。只用 ,所有点第一坐标都是一,射线与该集合可能根本不交,便丢失了合法无偏估计。负的估计系数不等于负的实验概率。
对偶可行性也须检查全部候选。若只在已选位置有 ,遗漏位置可能越界并提供更便宜的一范数表示,现有下界就没有依据。数值求解器输出很小的原始—对偶目标差,也不能替代这两侧的可行性检查。
若所有 只张成子空间 ,先判断 。在其中时可换到 的坐标,整个定理使用 ;不在其中时任何设计都不可估,。 则是另一个简单边界:恒零估计的方差为零,任意设计都最优,无需使用 的比例公式。
推论与应用
可估时怎样回到熟悉的矩阵表达式
对一个固定设计, 恰是正权实验向量的张成空间。因而可估性等价于存在 满足 。此时令
有 。任意其他可行系数写成 ,则 ;展开式(3)中的平方,交叉项为 ,所以
于是 ,而且不依赖满足 的解选哪一个。满秩时 ;奇异但可估时可取 。式(14)同时证明最优线性无偏性,说明伪逆公式的使用前提在哪里。
一份下界与一份可执行上界
任取满足 的 ,由对称性可换号使 。对任意设计和可用的无偏系数 ,式(8)–(10)给
这是一份实际可以交付的方差区间。下界平方时不能省略非负或绝对值的说明;对任意符号的可行 ,也可以先写 再平方。
对给定整数预算,连续最优值仍是下界,而任何满足 的无偏设计给上界。两界相等便认证整数最优;不相等时还须比较整数候选。最优比例的独立四舍五入可能让次数总和错误,甚至删去使目标可估的关键位置。
最优设计可只用至多p个位置
取对偶最优 。式(11)使 的所有有符号支持点落在 的面上,其仿射维数至多 。对这个面使用Carathéodory定理理路Carathéodory 定理Caratheodory theorem in convex geometry有限维凸包中的每个点都可由至多维数加一个原集合点的凸组合表示。,可用至多 个有符号实验向量表示 ,从而构造至多 个位置的最优设计。同一位置的正负向量不可能同时落在该面上,因为其内积互为相反数。这个结论允许信息矩阵秩亏,不要求这 个向量恰好独立。
坐标、尺度与实际误差预算
若 、,为了保留同一个目标,还必须取 。于是 与原约束等价,最优权重、 和归一化方差都不变。只变实验向量却忘记变 ,是在解另一个问题。
若把目标改为 ,,最佳方差乘 ,最优权重集合不变。噪声共同尺度与总次数最后按式(2)乘回 。预测一个独立新观测还要加上它自身的噪声方差,不能把这里对均值的最小方差直接当作整个预测误差。
终点练习用非轴向实验给出不同最优支持、整数次数和奇异可估证书。公开程序用精确线性代数枚举小规模原始基本解与对偶顶点,再交叉核验式(14);它不把浮点近似相等视作数学证明,也不宣称适合大规模求解。
参考资料