控制器看见的是带噪声的读数,付费的却是真实状态偏差和实际用力。先估计状态,再把估计代入 LQR,听起来合理;但“合理”还没有排除另一种非线性策略利用整段历史取得更低成本。本页补上这份最优性证明,并把看不清状态所增加的成本单独算出来。
形式陈述
模型、时序与允许的策略
固定整数 。已知确定性实矩阵 、、,其中 。系统为
先取得 ,再选择 ,随后过程噪声 进入下一状态。因此做决定时的信息是
表示这些已知量能够区分的事件。允许的策略为有限值 Borel 函数
并要求 。Borel 可测保证这是合法的随机变量;允许依赖全部已见历史,也允许非线性。没有把待比较的策略预先限制为线性增益。固定策略后,过去输入已由过去读数决定,把它们写进信息集是为了明确控制器记得自己做过什么。
初态和所有各期噪声相互独立,且
高斯分布允许退化的状态和过程噪声。矩阵、传感器与噪声分布都不随所选动作改变。目标是在上述策略中最小化
这里的权重与协方差均对称; 和 分别是半正定与正定理路正定与半正定矩阵Positive definite matrix · Positive semidefinite matrix · PSD matrix由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。。这是无约束、风险中性的期望成本问题。有限时域下不要求可控、可观、可稳定或可检测。 是保证普通创新逆存在的充分条件,不宣称它是所有 LQG 模型的必要条件。
平方可积输入经有限次线性递推产生平方可积状态,故 (2) 有限。若进一步允许任意有限值 Borel 策略,有限成本仍因 强制每期输入平方可积;其余无限成本策略不可能改进下面的有限最小值。
结论:两套递推与一份代价证书
从 开始,复用离散 LQR 的有限配平方递推理路离散时间线性二次调节器Discrete-time linear quadratic regulator · Discrete-time LQR从保持输入的精确采样出发,用有限时域配平方及稳定DARE解构造离散二次最优反馈。,逐期取相应矩阵:
同一个逐期配平方理由保证 ;不需要取无限时域极限。 是控制价值矩阵, 采用负反馈符号。
另一方面,以 初始化Kalman 过滤递推理路Kalman 滤波器Kalman filter · 卡尔曼滤波器在线性高斯状态空间模型中递推计算状态预测与过滤分布均值、协方差及似然的算法。:
最后一行只需执行到 ,因为终端没有决策。 由 保证。 是估计增益, 是估计误差协方差,不能与 (3) 的 混用。
有限时域 LQG 最优性。 对每个允许策略,(4) 都给出 和确定性的条件协方差 ,后者不依赖读数或策略。可实施的最优控制为
观察前的最小期望成本为
是矩阵对角元之和。第一行是同一随机系统在每期真实状态可见、但不能预知未来噪声时的最优成本;第二行是只看含噪输出的额外信息代价。达到最优的策略必须在自己生成的历史上满足 (5) 几乎必然;这不要求策略函数在概率为零的历史上逐点相同。
直觉
两套递推回答两个不同的问题。 从终点向前看:现在的状态误差会让余下过程付出多少代价? 随时间正向更新:此刻仍有多少状态误差没有被数据解释?控制目标决定 ;先验、过程噪声和测量质量决定 。两者在线连接时,估计器仍须知道已实施的输入。
两套递推与因果时序 “把估计当状态”称为确定性等价,但它不表示不确定性没有成本。即使最优控制满足 ,真实量 仍会波动,式 (6) 最后一项正是这些波动的平均二次代价。
本页的最优分离与确定性观测器的稳定分离理路基于观测器的输出反馈与分离原理Observer-based output feedback · Separation principle in linear control用输出创新驱动全阶观测器,在状态与估计误差坐标中证明块三角分离,复算双积分器四极点及估计暂态的额外代价。回答不同的问题。后者把连续无噪声闭环分成两个稳定块,并保留估计暂态的额外成本;本页在给定随机模型、先验和有限目标下比较所有因果观测策略。不能仅凭闭环极点稳定就得到 (5) 的最优性,也不能从有限最优性推出无限运行时的稳定保证。
例子与边界
两次观测之后,究竟施加什么输入
取 ,全部标量矩阵 。 相互独立且都服从 。
反向计算得到
正向估计的方差为
实际读数为 时,先有
下一次预测必须包含刚刚施加的控制:。于是
漏掉 就会用错误的预测基准解释第二次读数。这条读数路径确定两次控制,却没有告诉我们真实状态与实际总成本;下面的 是观察前对全部噪声平均的成本。
三个能独立复算的成本
先按 (6) 分解:
所以 。这里 包含过程噪声;它不是把噪声删除后的确定性 LQR 成本。
还可完全绕开 (6),用原始独立坐标 验算。由 (4)(5) 展开得
独立零均值、单位方差使每个线性式的二阶矩等于系数平方和。因此 依次贡献
总和仍是 。这是第二条核验路径,不是把答案再代回原公式。
若直接采用 ,同样展开得到五项成本
总和为 ,多花 。错误发生在把含噪输出当成条件均值,而非 LQR 增益算错。
只把第二次测量变得更嘈杂
令 ,其他条件不变。控制目标与动力学没有变,所以 全部不变。估计侧则变为
对相同读数 ,有 ;观察前成本为
相较原模型增加 。用原始坐标验算时也必须把 的方差改成 ,不能只改滤波增益却仍用单位方差求和。
非高斯时,失效的是哪一步
改成一阶段系统 ,初态等概率取 ,读数 , 与初态独立。最小化 ,仍只准按 决策。
两个似然之比是 ,故
条件于 ,目标恰为
因此真正最优输入是 。若误把同均值方差的初态当高斯,Kalman 会给出 ,相应控制是 ,条件成本差为
在 处约为 ;连续性使它在附近仍严格为正,而 的混合密度处处为正,故整体期望也严格增加。这里条件均值反馈仍然最优,失去的是“Kalman 线性估计等于条件均值”。不能把非高斯笼统解释成一切分离结论都失败。
推论与应用
第一步:对任意因果策略证明条件高斯闭包
先固定一个允许策略,并把全部初态、噪声放在同一个概率空间上。按“状态、读数、输入、下一状态”的顺序逐步生成,有限值 Borel 策略给出唯一可测轨迹,没有同一时刻需要互相求解的代数闭环。 只依赖当时及此前已进入系统的原始量,因此新的 独立于它们。
初次更新中 联合高斯。联合高斯的条件公式理路多元正态分布Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。允许状态协方差退化,只需被观测块 可逆;因此得到 (4) 的 。
归纳假设 ,且 是不依赖策略的确定矩阵。给定 后,已实施的 是已知平移量,而 独立,故
再加入独立的 ,给定旧历史的 联合高斯。对本次读数条件化,便得到 (4)。 已可由旧历史确定,所以加入它没有额外揭示隐藏状态;这次更新的信息正是 。
协方差公式只含旧协方差和给定矩阵,从而 仍确定、与策略及读数无关,归纳完成。证明使用的是给定历史后的高斯性。例如允许策略 本身就不是高斯随机变量;不能先假设任意反馈产生的整个闭环联合高斯,再调用条件公式。对连续时间模型,这个信息问题还需额外适定性分析,不能把本段离散归纳直接取形式极限。
第二步:随机配平方保留过程噪声
记 。 零均值且与 独立,所以
这里使用协方差理路协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。的二阶矩恒等式:对零均值 ,展开坐标就有 。
把旧 LQR 的逐期配平方关系用于 ,再取期望,得到
从 累加到 ,中间状态价值逐项抵消,终端由 对齐:
全部项可积,因此这里没有把两个无穷量相减;比较也没有限于线性策略。
第三步:条件正交隔离无法消除的误差
令 。 是 可测且平方可积的量,而 。复用条件期望的 $L^2$ 正交性理路条件期望Conditional expectation以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。,交叉项的期望为零,故
最后一步还用了 和塔式法则。第一步已经证明这个矩阵不随策略改变,因此 (7)(8) 给出真正可比较的恒等式
其中 就是 (6),是所有策略共享的常数。不能在没有证明协方差不变时,把一个可能随控制改变的“估计误差项”擅自移出最小化。
使剩余项非负。现在按 (4)(5) 正向构造策略:每一步只用已见信息,均值和输入都是有限次线性运算,故 Borel 且平方可积;它令所有平方为零,确实达到下界。反之最优时每项期望都为零,正定性推出 (5) 几乎必然。至此完成存在、可实施性及整个策略类中的最优性证明。式 (6) 的初态项来自 。
实现与使用范围
离线反向求出 ;协方差和 也可提前正向计算。在线只保存当前均值,依次“预测、读数更新、输出控制”。实现 (3)(4) 时分别对 用Cholesky 分解理路Cholesky 分解Cholesky factorization · Cholesky decomposition把 Hermitian 正定矩阵唯一分解为正对角下三角因子与其共轭转置的乘积。与线性求解,不必显式形成逆矩阵;后验协方差的数值稳定更新可沿用 Kalman 页的 Joseph 形式。
有限时域没有稳定性结论。例如 ,完全不可控、不可观,仍有合法最优输入 和成本 。观察噪声不能揭示状态,却不妨碍这个有限优化问题有解。
若动作改变传感器或噪声分布,第一步的协方差不变性不再自动成立;若加入输入或状态约束,(9) 的平方零点可能不可行。持续过程噪声下无限总成本还可能发散,平均成本与稳态稳定性应另行分析。本证明也没有借用有限折扣、有限状态 Bellman 算子的压缩结论来处理无界二次成本。
验收练习。 从原始五个独立噪声坐标重算 和 ,将第二次观测方差改成 后重算 ;最后解释 初态下应当更换估计器,而不是直接否定条件均值反馈。完整题目、结构迁移与可下载核验器见两步 LQG 控制终点。
参考资料