Skip to content

方法Method

连续时间线性二次调节器

Continuous-time linear quadratic regulator · Continuous-time LQR · 连续时间LQR

从零终端代价的有限时域 Riccati 解构造稳定 CARE 极限,在半正定状态代价下证明最优性与唯一性,并复算双积分器及双曲正切轨道。

形式陈述 ​

给定实常矩阵 A,B 与初态 x0,考虑连续时间系统 x′=Ax+Bu。输入取局部平方可积函数,状态为相应绝对连续解,允许无限代价。无限时域 LQR 在所有这些输入中最小化

J(u;x0)=∫0∞(xTQx+uTRu)dt,Q=QT⪰0,R=RT≻0.

这里无终点约束、无输入饱和,也无噪声;全状态可用于状态反馈。一般存在性定理采用两个条件:(A,B) 可稳定;(A,Q1/2) 可检测。后者的含义是存在矩阵 L,使 A−LQ1/2 为 Hurwitz;等价地,以 Q1/2x 为输出时,全部不可观模态自身稳定。它比可观测性弱。

在这些条件下,连续代数 Riccati 方程

ATP+PA−PBR−1BTP+Q=0

有唯一对称半正定稳定解 P,其中“稳定解”指 A−BR−1BTP 为 Hurwitz。最优反馈与最优值为

u∗=−Kx,K=R−1BTP,infuJ(u;x0)=x0TPx0.

本页从有限时域构造这个解。令 G=BR−1BT,以剩余时长 s 为自变量的 Riccati 方程为

(1)dSds=ATS+SA−SGS+Q,S(0)=0.

其解对所有 s≥0 存在,且 S(s)⪰0、随 s 按半正定序单调增加,并收敛到上述 P。有限时域 [0,T]、自由终态、零终端代价的价值是 x0TS(T)x0,最优反馈在时刻 t 使用 S(T−t)。不能把正向剩余时长方程 (1) 与反向终端条件的符号混用。

下面证明全部结论,包括 Q 仅半正定时的存在、稳定、最优及唯一性。一般最优矩阵可以有零特征值,CARE 也可能存在其他非半正定代数解。

直觉

极点配置先指定衰减模式,LQR 则先指定偏差与用力的价格。Q 惩罚哪些状态方向,R 决定各输入通道的成本;最优反馈由这两种价格和动力学共同决定。稳定只是行为约束之一,不能单凭“极点更负”判断代价更低。

代价中 xTQx=‖Q1/2x‖2,因此 Q1/2 像一个评估性能的输出矩阵,通常与实际传感器 C 不同。可检测性要求:在整个演化过程中始终不进入代价观测的模态,必须自身稳定。它排除的是不可观的不稳定模态,而一个瞬时落在 ker⁡Q 中的方向,仍可能经动力学进入受惩罚的坐标。

例如双积分器 A=(0100) 若只惩罚位置,即 Q=diag(1,0),虽有 Qe2=0,却有 Q1/2eAte2=(t,0)T。初速度随后变成位置偏差,因而能被代价观测;堆叠 Q1/2 与 Q1/2A 得到的观测矩阵仍有秩二。这个方向无需自行衰减,可检测性也照样成立。

固定初态后,状态是输入的仿射函数。以几乎处处相等识别局部平方可积输入,非负二次积分在这个实向量空间上定义取值于 [0,∞] 的凸函数。优化变量是一整条输入函数,因此这里使用的是函数空间上的凸性,不能直接把整个问题当成有限维二次规划。沿轨道配平方,可以直接建立适用于这些输入的最优性证书。

例子与边界

一个始终保留零方向的极限 ​

取

A=(000−2),B=(10),Q=(1000),R=1.

第二状态既不可控,也不被代价观察,但它自行衰减,所以可稳定与可检测条件都满足。系统与代价按两个坐标分离,(1) 的解为

S(T)=(tanh⁡T000).

直接验证:p(T)=tanh⁡T 满足 p′=1−p2、p(0)=0,其他矩阵分量恒为零。因此

S(T)↑P=(1000),K=(1 0),A−BK=diag(−1,−2).

无限时域最优控制为 u=−x1,最优值为 x1,02,与初始第二坐标无关。半正定 P 并不妨碍整个闭环稳定。

半正定价值矩阵的单调极限

图中蓝线是实际函数 tanh⁡T,虚线为极限一;红线是始终为零的第二特征值。矩阵按半正定序增加,极限仍有零方向,而对应闭环的两个极点均严格为负。

有限时域反馈为 u(t)=−tanh⁡(T−t)x1(t),解为

x1(t)=x1,0cosh⁡(T−t)cosh⁡T,u(t)=−x1,0sinh⁡(T−t)cosh⁡T.

积分 cosh2⁡s+sinh2⁡s=cosh⁡(2s),确得

JT=x1,02sinh⁡(2T)2cosh2⁡T=x1,02tanh⁡T.

有限时域在终点停止计费,所以 x1(T)=x1,0/cosh⁡T 不必为零。这与固定终点的最小能量问题有不同边界条件。

双积分器的最优增益与代价 ​

取

A=(0100),B=(01),Q=(1002),R=1.

该输入对可控,Q1/2=diag(1,2) 满秩,故上述条件成立。写 P=(pqqr),Riccati 方程逐项成为

1−q2=0,p−qr=0,2q+2−r2=0.

若 q=−1,则 r=p=0,所得矩阵不定。若 q=1,则 r=±2,p=r;负号给出负定矩阵,半正定分支只能是

P=(2112),K=(1 2).

P 的特征值为 1,3。闭环 A−BK=(01−1−2) 的特征多项式为 (s+1)2,虽有非平凡 Jordan 块,仍为 Hurwitz。下文的一般证明在这里适用;本例的 Q 还额外正定。

当 x0=e1,解为

x1(t)=(1+t)e−t,x2(t)=−te−t,u(t)=(t−1)e−t.

于是

J=∫0∞(2+4t2)e−2tdt=2⋅12+4⋅14=2=e1TPe1.

比较极点配置增益 Kpp=(2 3),仍使用同一 Q,R。令 App=A−BKpp,直接相乘可验证

H=(9/45/45/49/4),AppTH+HApp+Q+KppTKpp=0.

沿稳定闭环,ddt(xTHx)=−xT(Q+KppTKpp)x。积分且利用 x(t)→0,得到 Jpp(e1)=e1THe1=9/4>2。因此 −1,−2 两个稳定极点并没有胜过 LQR 的两个 −1;比较的依据是完整代价,而非谱的排序。

条件缺失时会怎样 ​

取标量 A=B=R=1,Q=0。系统可稳定,但成本观察完全看不见不稳定状态,故不可检测。u=0 的成本为零,状态却发散。Riccati 方程 2P−P2=0 有 P=0 与 P=2;前者给不稳定的最优控制,后者给稳定反馈却有成本 2x02。缺少可检测性时,不能把稳定 Riccati 分支直接称作所有输入中的最优解。

另一方面,A=−1,B=0,Q=0,R=1 满足可稳定与可检测条件,最优解却是 P=0。这说明一般定理只保证半正定,正定性需要更强条件。

推论与应用

有限时域:先局部求解,再以代价界延拓 ​

(1) 的右侧是矩阵元素的多项式,由Picard–Lindelöf 定理,从零初值有唯一局部解;对称性由转置后满足同一方程及唯一性保持。在它存在的任意 [0,h] 内,令

Πh(t)=S(h−t),Kh(t)=R−1BTΠh(t).

对任意 u∈L2([0,h]),状态绝对连续,乘积求导和配平方几乎处处成立:

xTQx+uTRu=−ddt(xTΠh(t)x)+(u+Kh(t)x)TR(u+Kh(t)x).

因为 Πh(h)=0,积分得到

(2)Jh(u;x0)=x0TS(h)x0+∫0h(u+Kh(t)x)TR(u+Kh(t)x)dt.

连续的时变反馈 u=−Kh(t)x 使平方项为零,线性方程的解存在且输入属于 L2,所以确实达到右侧下界。代价非负,故 S(h)⪰0。这一步没有先假设最优解存在。

由可稳定性,选 K0 使 F0=A−BK0 为 Hurwitz。它的无限代价矩阵

H=∫0∞eF0Tt(Q+K0TRK0)eF0tdt

有限且半正定。把 u=−K0x 限制到 [0,h],其有限代价不超过 x0THx0。由 (2) 的最小性,对所有存在时长都有

(3)0⪯S(h)⪯H.

因此 S 始终留在一个有界闭矩阵集合中,局部 Lipschitz 常微分方程不可能在有限正时间逃逸,解可延拓到所有 h≥0。

单调有界怎样推出 CARE ​

若 h2≥h1,任意 [0,h2] 输入的前 h1 段代价至少为该短时域的最优值,而后段代价非负。对长时域输入取下确界,得到

xTS(h1)x≤xTS(h2)x对每个 x.

结合 (3),先在整数时长上对每个二次型应用单调有界序列定理;任意实数时长夹在相邻整数之间,由单调性得到同一极限。用 x=ei 得到对角元收敛,用

2Sij(h)=(ei+ej)TS(h)(ei+ej)−Sii(h)−Sjj(h)

得到其余矩阵元也收敛。有限维中这给出矩阵范数极限 S(h)→P⪰0。

仅有函数收敛,不能直接断言导数趋零。这里还要使用方程:多项式右侧的连续性给出

S′(h)⟶ATP+PA−PGP+Q.

若右侧某个元素非零,对应导数最终保持同号且绝对值有正下界,该元素就不可能收敛。于是整个极限为零,P 满足 CARE。

可检测性排除不稳定特征向量 ​

写 CQ=Q1/2、K=R−1BTP、F=A−BK。CARE 等价于

(4)FTP+PF=−Q−KTRK.

若 Fv=λv,其中 v≠0 可以为复向量,且 Reλ≥0,则

2Reλv∗Pv=−‖CQv‖2−‖R1/2Kv‖2.

左侧非负、右侧非正,只能同时为零。因此 CQv=0 且 Kv=0,进而 Av=Fv=λv。可检测性给出某个 L 使 A−LCQ 稳定,但它仍把 v 映为 λv,矛盾。因此 F 为 Hurwitz。这个证明只用了 P⪰0,没有把它擅自加强为正定。

无限时域最优性与稳定解唯一性 ​

对任意局部平方可积输入,包括无限代价输入,非负积分及 (2) 给出

J(u;x0)≥Jh(u;x0)≥x0TS(h)x0.

令 h→∞,得到 J(u;x0)≥x0TPx0。这份下界证明无需先证明任意候选输入的状态趋零。

对所构造的反馈 u∗=−Kx,闭环已证明稳定,故 x(t) 与 u∗(t) 指数衰减。沿它积分 (4),得到

Jh(u∗;x0)=x0TPx0−x(h)TPx(h).

末项趋零,故它达到下界。最优输入按几乎处处相等唯一:若两份有限代价最优输入不同,取平均时状态也取平均,R≻0 使输入二次积分严格下降,而状态二次项凸,违反最优性。

最后,设 P1,P2 是两个对称稳定 CARE 解,记 D=P1−P2、Fi=A−GPi。相减整理得

F1TD+DF2=0.

所以 eF1TtDeF2t 的导数为零,始终等于 D;但两指数都趋零,又迫使 D=0。稳定对称解因而唯一。前面的特征向量论证适用于任意半正定 CARE 解,所以在可检测假设下,所有半正定解都稳定,也就只有这一份。

三种代价与输出实现 ​

这个单元的三个数有不同含义:在一单位时间内从零到 (1,0) 的最小输入能量是 12;无限时域从 (1,0) 调节到零的 LQR 代价是 2;同样权重下指定极点反馈的代价是 9/4。初末条件、时域和目标函数都必须一起写明,数字才可比较。

基于观测器的输出反馈在只测位置时动态补出速度估计,并以块三角矩阵证明稳定性。未知初态下的估计暂态仍会增加成本,稳定分离不意味着保持全状态已知时的最优代价。输入有约束或系统受噪声驱动时,还需要相应的约束优化或随机控制模型。离散时间 Kalman 递推中的 Riccati 方程描述估计误差协方差,这里的连续时间方程则描述控制的最优价值;二者的对象和时间模型各有明确含义。

离散时间 LQR从区间内保持输入出发,同时精确离散化动力学与积分成本;成本通常出现状态—输入交叉项,不能只替换状态矩阵后沿用原权重。该页再从有限 Riccati 递推证明稳定 DARE 极限,并复算标量黄金比解。加入输入约束后,模型预测控制将每次预测写成二次规划,以值 14 的两步计划展示饱和成本,再用终端不变性与移位候选证明递归可行及价值下降。

参考资料
  • André L. Tits, Notes for ENEE 664: Optimal Control, September 2024,§2.1.1 的有限时域 Riccati 延拓、§2.1.2 的 Lemma 2.3 与 Theorems 2.5–2.7, pp. 24–30:单调有界极限、可检测性与稳定解。本页保留一般 R≻0,在有限区间用绝对连续求导将平方恒等式用于 L2 输入,并以 Sylvester 恒等式直接证明唯一性。
  • Jonathan How,MIT 16.323,Spring 2008,讲义日期 2008-06-18,Lecture 4: Linear Quadratic Regulators,4–8 至 4–10,无限时域 CARE、可稳定与可检测条件及半正定解。
  • Stephen Boyd,Stanford EE363,Winter 2008–09,Lecture 4: Continuous-time Linear Quadratic Regulator,4–7 至 4–10 的二次价值函数推导,4–21 至 4–23 的无限时域方程。该稿的反馈符号与本文约定不同,本文统一采用 u=−Kx。
关系图谱22 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系