Skip to content

两步LQG控制终点:输入、信息与成本 ​

返回核心学习路线

只看带噪声的读数,也可以给出可核验的最优控制。这个终点要求同时交出三样东西:能实际执行的输入、覆盖所有允许策略的理由,以及独立于最优值公式的成本账本。

先读离散 LQR 的有限配平方、Kalman 过滤与条件期望的正交性,再进入有限时域 LQG 最优性定理。不需要先掌握稳态 DARE、连续时间随机微积分或一般部分可观测决策理论。

一套固定的两步模型 ​

取 t=0,1,系统为

xt+1=xt+ut+wt,yt=xt+vt.

初态 x0 和 w0,w1,v0,v1 相互独立且均为 N(0,1)。每次先看见 yt,再选择 ut,然后才有新过程噪声进入下一状态。目标是

J=E[x02+u02+x12+u12+x22].

策略可以是观测历史的任意有限值 Borel 函数,只需实际输入平方可积。不能读取 xt,也不能提前读取 y1。本页没有状态和输入约束。

符号约定:Pt,Ht,Kt 属于控制侧,Gt,Σt,mt 属于估计侧,且 ut=−Ktmt。终端是 P2=1;观测前的初态先验是 m0−=0,Σ0−=1。

任务一:把两套递推接成可执行控制器 ​

  1. 从 P2=1 反向计算 H1,K1,P1,H0,K0,P0,说明为什么每次除法合法
  2. 从初始先验正向计算 G0,Σ0,Σ1−,G1,Σ1,说明预测为什么要加过程方差
  3. 读数为 y0=2,y1=1 时,依次给出 m0,u0,m1−,m1,u1。在式子里圈出已实施的 u0
  4. 分别回答:控制增益、误差协方差、条件均值中,哪些依赖这一次的读数?
核对:递推与输入

反向结果为

(P2,H1,K1,P1,H0,K0,P0)=(1,2,12,32,52,35,85).

Ht=1+Pt+1>0。前向结果为

(G0,Σ0,Σ1−,G1,Σ1)=(12,12,32,35,35).

第一期后验方差为 1/2,新的过程噪声再贡献 1。创新方差分别为 2,5/2,都严格为正。

读数路径给出

m0=1,u0=−35,m1−=m0+u0=25,m1=1925,u1=−1950.

只有均值随读数变化;本模型的两组增益和误差协方差均能预先计算。初次测量发生在第一次控制前,不能先把 u0 放进 m0−。

任务二:用两条独立路径核算成本 ​

先用定理的成本分解,分别算全状态可见成本、两个时刻的信息代价和总成本。再把每个状态、输入写成原始向量

z=(x0,w0,w1,v0,v1)T

的线性式,仅靠原始量的独立性与方差求二阶矩。第二条路径中不要引用最优值公式。

继续测试一种真实的错误策略:直接令 u0=−3y0/5,u1=−y1/2。为这条策略重新生成 x1,y1,x2,不能沿用正确策略生成的中间状态。求其成本及超额成本。

核对:三个成本和原始系数

全状态可见时

Jfull=P0Var(x0)+P1Var(w0)+P2Var(w1)=4110.

信息代价为 9/20+3/10=3/4,总成本是 97/20。全状态基准仍受相同过程噪声驱动,只有可用信息不同。

在上述 z 的固定次序下,正确控制器的五个系数行为

x0w0w1v0v1x010000u0−3/1000−3/100x17/1010−3/100u1−1/4−3/1001/20−3/10x29/207/101−1/4−3/10

每行系数平方和依次为 1,9/50,79/50,49/200,369/200,总和为 97/20。

原始输出策略的五个系数行为

x0w0w1v0v1x010000u0−3/500−3/50x12/510−3/50u1−1/5−1/203/10−1/2x21/51/21−3/10−1/2

其成本为 1+18/25+38/25+63/100+163/100=11/2,相对正确策略多 13/20。这说明同样的控制增益,乘上错误的估计对象也会付出明确代价。

任务三:解释为什么没有更好的非线性策略 ​

这道题不能用“两次矩阵乘法都算对了”替代证明。请补齐以下三处,并说明每处假设的作用:

  1. 固定任意因果策略,归纳证明给定已见历史后的状态仍高斯,协方差不随策略改变。为什么 ut−1 在预测时是已知平移量?为什么这不等于整个闭环联合高斯?
  2. 对逐期 LQR 配平方式取期望,再求和,写出每一项过程噪声留下的迹。哪一个独立性让交叉项消失?
  3. 令 et=xt−E[xt∣It],对可见的 ut+Ktmt 应用条件正交。为什么必须先知道 Σt 不依赖策略,才可把它当作共同常数?最后核验平方零点确实可因果实施
核对:覆盖策略类的证书

完整证书是

J(π)=E[x0TP0x0]+∑ttr(Pt+1Wt)+∑ttr(KtTHtKtΣt)+∑tE[(ut+Ktmt)THt(ut+Ktmt)].

前面三项不随策略改变,最后一行非负。正向使用条件均值过滤并施加 −Ktmt,令最后一行全为零。这个策略是有限次线性递推,满足可测与平方可积要求。因此它达到下界,而不是只得到了一个可能无法执行的最小点。

反例提示:u0=y02 是允许的平方可积非线性输入,它已经不是高斯随机变量。不能假设任意策略下状态、观测、控制全都联合高斯。归纳中的条件分布则仍成立,因为每次给定旧历史后,已经施加的输入就是已知数。

细节与一般矩阵证明见主定理的三步证明。本题的任务是核对条件和逻辑次序;数值核验器不能替代对整个策略类的证明。

任务四:信息质量迁移与有限时域边界 ​

只把第二次测量噪声方差改成 4,仍保持原始五个量相互独立高斯。

  • 哪些控制量完全不变?重算 G1,Σ1
  • 对相同读数 2,1,重算 m1,u1
  • 用成本分解及原始噪声加权平方和,各算一次新期望成本。解释为何两条方法都必须修改 v1 的方差
  • 进一步取 N=1,A=2,B=C=0,Q=R=Pf=Π0=V0=1,W0=0,μ0=0。系统既不可控又不可观;有限最优输入和成本是否仍存在?
核对:更差的测量与不可控系统

控制侧 Pt,Ht,Kt 不变,估计侧为 G1=3/11,Σ1=12/11。路径上 m1=31/55,u1=−31/110。新成本是

4110+920+611=1121220,

比原先多 27/110。原始坐标路线应计算 a12+a22+a32+a42+4a52;核验器同时输出新的五行系数,供逐项检查。

第二个一阶段系统的输入完全不能改变状态,且有正输入价格,所以唯一最优输入是 0。x1=2x0,成本为 E[x02+x12]=5。有限最优解存在,不意味着同一个开环系统在无限时间内稳定。这里也没有试图通过传感器重建那个不可观状态。

任务五:把高斯先验换成两个可能状态 ​

取一阶段系统 x1=x0+u0,x0 等概率为 ±1,v∼N(0,1) 与它独立,y=x0+v,成本仍是 E[x02+u02+x12]。

从两个似然直接算 E[x0∣y],不要套高斯条件公式。条件于 y 配平方,写出真正最优控制;再比较仅凭均值方差使用 Kalman 得到的控制。回答:这个例子否定了“线性 Kalman 仍精确”,还是否定了“条件均值反馈仍最优”?

核对:失效定位而非笼统否定

似然比为 e2y,所以条件均值是 tanh⁡y,后验方差是 1−tanh2⁡y,已经随读数改变。条件成本为

2−12tanh2⁡y+2(u0+12tanh⁡y)2,

所以最优输入仍是 LQR 增益 1/2 乘以真正条件均值,带负号。Kalman 的线性估计 y/2 导致输入 −y/4,条件超额成本为 (y−2tanh⁡y)2/8。

在 y=1 约为 0.0342157512;该值是给定读数的成本差,不是对全部读数平均的超额成本。它连续并在正概率邻域严格为正,足以证明整体严格劣化。失败的是高斯闭包与 Kalman 精确性;本例条件均值反馈的最优性仍由显式配平方成立。

下载、复算与来源核对 ​

下载 Python 标准库核验器。保存后运行:

sh
python foundations-lqg-checker.py
python foundations-lqg-checker.py --v1 4 --observations 2 1
python foundations-lqg-checker.py --v1 3/2 --observations -1/2 3

它用精确分数分别计算 Riccati 成本与原始噪声成本,并检查估计误差对可见量的正交性;无需 NumPy、联网或随机仿真。可改变第二次测量方差和两次读数,不能藉此改变模型其他部分。零或负的测量方差会被拒绝,因为脚本按主定理所选的严格正定观测条件验收。内置检查不用可被优化模式删除的断言,python -O 也会执行全部检查。非高斯例的 tanh(1) 与成本差标为浮点评估,精确公式和严格劣化理由仍在正文。

全部数值通过,只完成了算例核验。交卷还需写明下列来源与当前结论的对应条件:

  • MIT 6.231 Lecture 6,第3、6–13页:信息历史、估计误差与控制的分离;第13页还区分非高斯条件均值与 Kalman 估计。本题用自己的条件高斯归纳证明策略无关协方差
  • Stanford EE363 Lecture 10,10–2至10–15页:有限 LQG 与成本分解。源的反馈增益带负号;本题把负号写在控制律前。后续无限平均成本不是本题的有限总成本
  • Georgiou–Lindquist,2013,pp.2483–2485,Remark 4、6:未经证明的控制独立性和连续时间形式外推为何危险。本题依靠离散时序逐步生成轨迹,不把连续时间论文中的更强结果当成免费前置

能同时给出数值、证明条件和失效位置,才算完成这个终点。