两步LQG控制终点:输入、信息与成本
返回核心学习路线
只看带噪声的读数,也可以给出可核验的最优控制。这个终点要求同时交出三样东西:能实际执行的输入、覆盖所有允许策略的理由,以及独立于最优值公式的成本账本。
先读离散 LQR 的有限配平方理路离散时间线性二次调节器Discrete-time linear quadratic regulator · Discrete-time LQR从保持输入的精确采样出发,用有限时域配平方及稳定DARE解构造离散二次最优反馈。、Kalman 过滤理路Kalman 滤波器Kalman filter · 卡尔曼滤波器在线性高斯状态空间模型中递推计算状态预测与过滤分布均值、协方差及似然的算法。与条件期望的正交性理路条件期望Conditional expectation以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。,再进入有限时域 LQG 最优性定理理路有限时域LQG的最优输出反馈Finite-horizon LQG output feedback · 有限时域线性二次高斯控制 · LQG估计与控制分离在有限时域线性高斯模型中,证明任意因果观测策略下的协方差不变性,并用配平方与条件正交构造最优输出反馈、计算信息代价。。不需要先掌握稳态 DARE、连续时间随机微积分或一般部分可观测决策理论。
一套固定的两步模型
取 ,系统为
初态 和 相互独立且均为 。每次先看见 ,再选择 ,然后才有新过程噪声进入下一状态。目标是
策略可以是观测历史的任意有限值 Borel 函数,只需实际输入平方可积。不能读取 ,也不能提前读取 。本页没有状态和输入约束。
符号约定: 属于控制侧, 属于估计侧,且 。终端是 ;观测前的初态先验是 。
任务一:把两套递推接成可执行控制器
- 从 反向计算 ,说明为什么每次除法合法
- 从初始先验正向计算 ,说明预测为什么要加过程方差
- 读数为 时,依次给出 。在式子里圈出已实施的
- 分别回答:控制增益、误差协方差、条件均值中,哪些依赖这一次的读数?
反向结果为
。前向结果为
第一期后验方差为 ,新的过程噪声再贡献 。创新方差分别为 ,都严格为正。
读数路径给出
只有均值随读数变化;本模型的两组增益和误差协方差均能预先计算。初次测量发生在第一次控制前,不能先把 放进 。
任务二:用两条独立路径核算成本
先用定理的成本分解,分别算全状态可见成本、两个时刻的信息代价和总成本。再把每个状态、输入写成原始向量
的线性式,仅靠原始量的独立性与方差求二阶矩。第二条路径中不要引用最优值公式。
继续测试一种真实的错误策略:直接令 。为这条策略重新生成 ,不能沿用正确策略生成的中间状态。求其成本及超额成本。
全状态可见时
信息代价为 ,总成本是 。全状态基准仍受相同过程噪声驱动,只有可用信息不同。
在上述 的固定次序下,正确控制器的五个系数行为
每行系数平方和依次为 ,总和为 。
原始输出策略的五个系数行为
其成本为 ,相对正确策略多 。这说明同样的控制增益,乘上错误的估计对象也会付出明确代价。
任务三:解释为什么没有更好的非线性策略
这道题不能用“两次矩阵乘法都算对了”替代证明。请补齐以下三处,并说明每处假设的作用:
- 固定任意因果策略,归纳证明给定已见历史后的状态仍高斯,协方差不随策略改变。为什么 在预测时是已知平移量?为什么这不等于整个闭环联合高斯?
- 对逐期 LQR 配平方式取期望,再求和,写出每一项过程噪声留下的迹。哪一个独立性让交叉项消失?
- 令 ,对可见的 应用条件正交。为什么必须先知道 不依赖策略,才可把它当作共同常数?最后核验平方零点确实可因果实施
完整证书是
前面三项不随策略改变,最后一行非负。正向使用条件均值过滤并施加 ,令最后一行全为零。这个策略是有限次线性递推,满足可测与平方可积要求。因此它达到下界,而不是只得到了一个可能无法执行的最小点。
反例提示: 是允许的平方可积非线性输入,它已经不是高斯随机变量。不能假设任意策略下状态、观测、控制全都联合高斯。归纳中的条件分布则仍成立,因为每次给定旧历史后,已经施加的输入就是已知数。
细节与一般矩阵证明见主定理的三步证明理路有限时域LQG的最优输出反馈Finite-horizon LQG output feedback · 有限时域线性二次高斯控制 · LQG估计与控制分离在有限时域线性高斯模型中,证明任意因果观测策略下的协方差不变性,并用配平方与条件正交构造最优输出反馈、计算信息代价。。本题的任务是核对条件和逻辑次序;数值核验器不能替代对整个策略类的证明。
任务四:信息质量迁移与有限时域边界
只把第二次测量噪声方差改成 ,仍保持原始五个量相互独立高斯。
- 哪些控制量完全不变?重算
- 对相同读数 ,重算
- 用成本分解及原始噪声加权平方和,各算一次新期望成本。解释为何两条方法都必须修改 的方差
- 进一步取 。系统既不可控又不可观;有限最优输入和成本是否仍存在?
控制侧 不变,估计侧为 。路径上 。新成本是
比原先多 。原始坐标路线应计算 ;核验器同时输出新的五行系数,供逐项检查。
第二个一阶段系统的输入完全不能改变状态,且有正输入价格,所以唯一最优输入是 。,成本为 。有限最优解存在,不意味着同一个开环系统在无限时间内稳定。这里也没有试图通过传感器重建那个不可观状态。
任务五:把高斯先验换成两个可能状态
取一阶段系统 , 等概率为 , 与它独立,,成本仍是 。
从两个似然直接算 ,不要套高斯条件公式。条件于 配平方,写出真正最优控制;再比较仅凭均值方差使用 Kalman 得到的控制。回答:这个例子否定了“线性 Kalman 仍精确”,还是否定了“条件均值反馈仍最优”?
似然比为 ,所以条件均值是 ,后验方差是 ,已经随读数改变。条件成本为
所以最优输入仍是 LQR 增益 乘以真正条件均值,带负号。Kalman 的线性估计 导致输入 ,条件超额成本为 。
在 约为 ;该值是给定读数的成本差,不是对全部读数平均的超额成本。它连续并在正概率邻域严格为正,足以证明整体严格劣化。失败的是高斯闭包与 Kalman 精确性;本例条件均值反馈的最优性仍由显式配平方成立。
下载、复算与来源核对
下载 Python 标准库核验器。保存后运行:
shpython foundations-lqg-checker.py
python foundations-lqg-checker.py --v1 4 --observations 2 1
python foundations-lqg-checker.py --v1 3/2 --observations -1/2 3
1
2
3
它用精确分数分别计算 Riccati 成本与原始噪声成本,并检查估计误差对可见量的正交性;无需 NumPy、联网或随机仿真。可改变第二次测量方差和两次读数,不能藉此改变模型其他部分。零或负的测量方差会被拒绝,因为脚本按主定理所选的严格正定观测条件验收。内置检查不用可被优化模式删除的断言,python -O 也会执行全部检查。非高斯例的 tanh(1) 与成本差标为浮点评估,精确公式和严格劣化理由仍在正文。
全部数值通过,只完成了算例核验。交卷还需写明下列来源与当前结论的对应条件:
能同时给出数值、证明条件和失效位置,才算完成这个终点。