Skip to content

定理Theorem

有限时域LQG的最优输出反馈

Finite-horizon LQG output feedback · 有限时域线性二次高斯控制 · LQG估计与控制分离

在有限时域线性高斯模型中,证明任意因果观测策略下的协方差不变性,并用配平方与条件正交构造最优输出反馈、计算信息代价。

控制器看见的是带噪声的读数,付费的却是真实状态偏差和实际用力。先估计状态,再把估计代入 LQR,听起来合理;但“合理”还没有排除另一种非线性策略利用整段历史取得更低成本。本页补上这份最优性证明,并把看不清状态所增加的成本单独算出来。

形式陈述 ​

模型、时序与允许的策略 ​

固定整数 N≥1。已知确定性实矩阵 At∈Rn×n、Bt∈Rn×m、Ct∈Rp×n,其中 n,m,p≥1。系统为

(1)xt+1=Atxt+Btut+wt,yt=Ctxt+vt,0≤t<N.

先取得 yt,再选择 ut,随后过程噪声 wt 进入下一状态。因此做决定时的信息是

It=σ(y0,…,yt,u0,…,ut−1).

σ(⋯) 表示这些已知量能够区分的事件。允许的策略为有限值 Borel 函数

ut=πt(y0,…,yt,u0,…,ut−1),

并要求 E‖ut‖2<∞。Borel 可测保证这是合法的随机变量;允许依赖全部已见历史,也允许非线性。没有把待比较的策略预先限制为线性增益。固定策略后,过去输入已由过去读数决定,把它们写进信息集是为了明确控制器记得自己做过什么。

初态和所有各期噪声相互独立,且

x0∼N(μ0,Π0),wt∼N(0,Wt),vt∼N(0,Vt),Π0,Wt⪰0,Vt≻0.

高斯分布允许退化的状态和过程噪声。矩阵、传感器与噪声分布都不随所选动作改变。目标是在上述策略中最小化

(2)J(π)=E[∑t=0N−1(xtTQtxt+utTRtut)+xNTPfxN],Qt,Pf⪰0, Rt≻0.

这里的权重与协方差均对称;⪰0 和 ≻0 分别是半正定与正定。这是无约束、风险中性的期望成本问题。有限时域下不要求可控、可观、可稳定或可检测。Vt≻0 是保证普通创新逆存在的充分条件,不宣称它是所有 LQG 模型的必要条件。

平方可积输入经有限次线性递推产生平方可积状态,故 (2) 有限。若进一步允许任意有限值 Borel 策略,有限成本仍因 Rt≻0 强制每期输入平方可积;其余无限成本策略不可能改进下面的有限最小值。

结论:两套递推与一份代价证书 ​

从 PN=Pf 开始,复用离散 LQR 的有限配平方递推,逐期取相应矩阵:

(3)Ht=Rt+BtTPt+1Bt,Kt=Ht−1BtTPt+1At,Pt=Qt+AtTPt+1At−AtTPt+1BtHt−1BtTPt+1At,t=N−1,…,0.

同一个逐期配平方理由保证 Pt⪰0,Ht≻0;不需要取无限时域极限。Pt 是控制价值矩阵,Kt 采用负反馈符号。

另一方面,以 m0−=μ0,Σ0−=Π0 初始化Kalman 过滤递推:

(4)Ft=CtΣt−CtT+Vt,Gt=Σt−CtTFt−1,mt=mt−+Gt(yt−Ctmt−),Σt=Σt−−GtFtGtT,mt+1−=Atmt+Btut,Σt+1−=AtΣtAtT+Wt.

最后一行只需执行到 t=N−2,因为终端没有决策。Ft≻0 由 Vt≻0 保证。Gt 是估计增益,Σt 是估计误差协方差,不能与 (3) 的 Kt,Pt 混用。

有限时域 LQG 最优性。 对每个允许策略,(4) 都给出 mt=E[xt∣It] 和确定性的条件协方差 Σt,后者不依赖读数或策略。可实施的最优控制为

(5)ut∗=−Ktmt.

观察前的最小期望成本为

(6)J∗=μ0TP0μ0+tr(P0Π0)+∑t=0N−1tr(Pt+1Wt)+∑t=0N−1tr(KtTHtKtΣt).

tr 是矩阵对角元之和。第一行是同一随机系统在每期真实状态可见、但不能预知未来噪声时的最优成本;第二行是只看含噪输出的额外信息代价。达到最优的策略必须在自己生成的历史上满足 (5) 几乎必然;这不要求策略函数在概率为零的历史上逐点相同。

直觉

两套递推回答两个不同的问题。Pt 从终点向前看:现在的状态误差会让余下过程付出多少代价?Σt 随时间正向更新:此刻仍有多少状态误差没有被数据解释?控制目标决定 Kt;先验、过程噪声和测量质量决定 Gt。两者在线连接时,估计器仍须知道已实施的输入。

两套递推与因果时序

“把估计当状态”称为确定性等价,但它不表示不确定性没有成本。即使最优控制满足 ut+Ktmt=0,真实量 ut+Ktxt=Kt(xt−mt) 仍会波动,式 (6) 最后一项正是这些波动的平均二次代价。

本页的最优分离与确定性观测器的稳定分离回答不同的问题。后者把连续无噪声闭环分成两个稳定块,并保留估计暂态的额外成本;本页在给定随机模型、先验和有限目标下比较所有因果观测策略。不能仅凭闭环极点稳定就得到 (5) 的最优性,也不能从有限最优性推出无限运行时的稳定保证。

例子与边界

两次观测之后,究竟施加什么输入 ​

取 N=2,全部标量矩阵 A=B=C=Q=R=Pf=1。x0,w0,w1,v0,v1 相互独立且都服从 N(0,1)。

反向计算得到

P2=1, H1=2, K1=12, P1=32,H0=52, K0=35, P0=85.

正向估计的方差为

G0=12,Σ0=12,Σ1−=32,G1=35,Σ1=35.

实际读数为 y0=2,y1=1 时,先有

m0=1,u0=−35.

下一次预测必须包含刚刚施加的控制:m1−=m0+u0=2/5。于是

m1=25+35(1−25)=1925,u1=−1950.

漏掉 u0 就会用错误的预测基准解释第二次读数。这条读数路径确定两次控制,却没有告诉我们真实状态与实际总成本;下面的 97/20 是观察前对全部噪声平均的成本。

三个能独立复算的成本 ​

先按 (6) 分解:

Jfull=85+32+1=4110,Jinfo=(35)25212+(12)2235=920+310=34.

所以 J∗=97/20。这里 Jfull 包含过程噪声;它不是把噪声删除后的确定性 LQR 成本。

还可完全绕开 (6),用原始独立坐标 z=(x0,w0,w1,v0,v1)T 验算。由 (4)(5) 展开得

u0=−310x0−310v0,x1=710x0+w0−310v0,u1=−14x0−310w0+120v0−310v1,x2=920x0+710w0+w1−14v0−310v1.

独立零均值、单位方差使每个线性式的二阶矩等于系数平方和。因此 x0,u0,x1,u1,x2 依次贡献

1,950,7950,49200,369200,

总和仍是 97/20。这是第二条核验路径,不是把答案再代回原公式。

若直接采用 u0=−3y0/5,u1=−y1/2,同样展开得到五项成本

1,1825,3825,63100,163100,

总和为 11/2,多花 13/20。错误发生在把含噪输出当成条件均值,而非 LQR 增益算错。

只把第二次测量变得更嘈杂 ​

令 Var(v1)=4,其他条件不变。控制目标与动力学没有变,所以 Pt,Ht,Kt 全部不变。估计侧则变为

G1=3/23/2+4=311,Σ1=1211.

对相同读数 2,1,有 m1=31/55,u1=−31/110;观察前成本为

4110+920+611=1121220.

相较原模型增加 27/110。用原始坐标验算时也必须把 v1 的方差改成 4,不能只改滤波增益却仍用单位方差求和。

非高斯时,失效的是哪一步 ​

改成一阶段系统 x1=x0+u0,初态等概率取 ±1,读数 y=x0+v,v∼N(0,1) 与初态独立。最小化 E[x02+u02+x12],仍只准按 y 决策。

两个似然之比是 e2y,故

P(x0=1∣y)=e2y1+e2y,m(y)=E[x0∣y]=tanh⁡y.

条件于 y,目标恰为

2+2u02+2u0tanh⁡y=2−12tanh2⁡y+2(u0+12tanh⁡y)2.

因此真正最优输入是 −tanh⁡(y)/2。若误把同均值方差的初态当高斯,Kalman 会给出 y/2,相应控制是 −y/4,条件成本差为

(y−2tanh⁡y)28.

在 y=1 处约为 0.0342157512;连续性使它在附近仍严格为正,而 y 的混合密度处处为正,故整体期望也严格增加。这里条件均值反馈仍然最优,失去的是“Kalman 线性估计等于条件均值”。不能把非高斯笼统解释成一切分离结论都失败。

推论与应用

第一步:对任意因果策略证明条件高斯闭包 ​

先固定一个允许策略,并把全部初态、噪声放在同一个概率空间上。按“状态、读数、输入、下一状态”的顺序逐步生成,有限值 Borel 策略给出唯一可测轨迹,没有同一时刻需要互相求解的代数闭环。xt,ut 只依赖当时及此前已进入系统的原始量,因此新的 wt 独立于它们。

初次更新中 (x0,y0) 联合高斯。联合高斯的条件公式允许状态协方差退化,只需被观测块 F0 可逆;因此得到 (4) 的 m0,Σ0。

归纳假设 xt−1∣It−1∼N(mt−1,Σt−1),且 Σt−1 是不依赖策略的确定矩阵。给定 It−1 后,已实施的 ut−1 是已知平移量,而 wt−1 独立,故

xt∣It−1∼N(At−1mt−1+Bt−1ut−1,At−1Σt−1At−1T+Wt−1).

再加入独立的 vt,给定旧历史的 (xt,yt) 联合高斯。对本次读数条件化,便得到 (4)。ut−1 已可由旧历史确定,所以加入它没有额外揭示隐藏状态;这次更新的信息正是 It。

协方差公式只含旧协方差和给定矩阵,从而 Σt 仍确定、与策略及读数无关,归纳完成。证明使用的是给定历史后的高斯性。例如允许策略 u0=y02 本身就不是高斯随机变量;不能先假设任意反馈产生的整个闭环联合高斯,再调用条件公式。对连续时间模型,这个信息问题还需额外适定性分析,不能把本段离散归纳直接取形式极限。[1]

第二步:随机配平方保留过程噪声 ​

记 at=Atxt+Btut。wt 零均值且与 at 独立,所以

E[xt+1TPt+1xt+1]=E[atTPt+1at]+tr(Pt+1Wt).

这里使用协方差的二阶矩恒等式:对零均值 z,展开坐标就有 E[zTMz]=∑ijMijE[zizj]=tr(MCovz)。

把旧 LQR 的逐期配平方关系用于 xt,ut,at,再取期望,得到

E[xtTQtxt+utTRtut]+E[xt+1TPt+1xt+1]=E[xtTPtxt]+E[(ut+Ktxt)THt(ut+Ktxt)]+tr(Pt+1Wt).

从 0 累加到 N−1,中间状态价值逐项抵消,终端由 PN=Pf 对齐:

(7)J(π)=E[x0TP0x0]+∑ttr(Pt+1Wt)+∑tE[(ut+Ktxt)THt(ut+Ktxt)].

全部项可积,因此这里没有把两个无穷量相减;比较也没有限于线性策略。

第三步:条件正交隔离无法消除的误差 ​

令 et=xt−mt。ut+Ktmt 是 It 可测且平方可积的量,而 E[et∣It]=0。复用条件期望的 $L^2$ 正交性,交叉项的期望为零,故

(8)E[(ut+Ktxt)THt(ut+Ktxt)]=E[(ut+Ktmt)THt(ut+Ktmt)]+tr(KtTHtKtΣt).

最后一步还用了 E[etetT∣It]=Σt 和塔式法则。第一步已经证明这个矩阵不随策略改变,因此 (7)(8) 给出真正可比较的恒等式

(9)J(π)=J∗+∑tE[(ut+Ktmt)THt(ut+Ktmt)],

其中 J∗ 就是 (6),是所有策略共享的常数。不能在没有证明协方差不变时,把一个可能随控制改变的“估计误差项”擅自移出最小化。[2]

Ht≻0 使剩余项非负。现在按 (4)(5) 正向构造策略:每一步只用已见信息,均值和输入都是有限次线性运算,故 Borel 且平方可积;它令所有平方为零,确实达到下界。反之最优时每项期望都为零,正定性推出 (5) 几乎必然。至此完成存在、可实施性及整个策略类中的最优性证明。式 (6) 的初态项来自 E[x0TP0x0]=μ0TP0μ0+tr(P0Π0)。[3]

实现与使用范围 ​

离线反向求出 Kt;协方差和 Gt 也可提前正向计算。在线只保存当前均值,依次“预测、读数更新、输出控制”。实现 (3)(4) 时分别对 Ht,Ft 用Cholesky 分解与线性求解,不必显式形成逆矩阵;后验协方差的数值稳定更新可沿用 Kalman 页的 Joseph 形式。

有限时域没有稳定性结论。例如 N=1,A=2,B=C=0,Q=R=Pf=1,Π0=V0=1,W0=0,μ0=0,完全不可控、不可观,仍有合法最优输入 u0=0 和成本 1+4=5。观察噪声不能揭示状态,却不妨碍这个有限优化问题有解。

若动作改变传感器或噪声分布,第一步的协方差不变性不再自动成立;若加入输入或状态约束,(9) 的平方零点可能不可行。持续过程噪声下无限总成本还可能发散,平均成本与稳态稳定性应另行分析。本证明也没有借用有限折扣、有限状态 Bellman 算子的压缩结论来处理无界二次成本。

验收练习。 从原始五个独立噪声坐标重算 97/20 和 11/2,将第二次观测方差改成 4 后重算 1121/220;最后解释 ±1 初态下应当更换估计器,而不是直接否定条件均值反馈。完整题目、结构迁移与可下载核验器见两步 LQG 控制终点。

参考资料
  1. T. T. Georgiou 与 A. Lindquist,The Separation Principle in Stochastic Control, Redux,IEEE TAC 58(10),2013,pp.2483–2485,特别是 Remark 4、Remark 6:反馈信息依赖与条件高斯的区别。该论文主要处理连续时间;本页仅借其辨析定位证明义务,不援引它替代离散归纳。 ↩︎

  2. Dimitri Bertsekas,MIT 6.231,2015,Lecture 6,讲义第3、6–13页,尤其第9–10页:策略信息、估计误差与控制的分离。该源还讨论非高斯条件均值;本页的高斯闭包证明不声称涵盖全部非高斯模型。 ↩︎

  3. Stephen Boyd,Stanford EE363,2008–09,Lecture 10: Linear Quadratic Stochastic Control with Partial State Observation,10–2至10–15页:有限时域、两组增益与全状态成本/估计成本分解。原稿使用带负号的增益,本页统一为 u=−Km;两步数值与非高斯对照均由文中明确模型独立计算。10–16起的无限时域平均成本不在本页结论内。 ↩︎

关系图谱21 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系