Skip to content

方法Method

连续时间线性二次调节器

Continuous-time linear quadratic regulator · LQR · 线性二次调节器

在可稳定与代价可检测条件下,通过稳定 Riccati 解求无限时域二次代价的最优状态反馈。

形式陈述 ​

给定实常矩阵 A,B 与初态 x0,考虑连续时间系统 x′=Ax+Bu。输入取局部平方可积函数,状态为相应绝对连续解,允许无限代价。无限时域 LQR 在所有这些输入中最小化

J(u;x0)=∫0∞(xTQx+uTRu)dt,Q=QT⪰0,R=RT≻0.

这里无终点约束、无输入饱和,也无噪声;全状态可用于状态反馈。一般存在性定理采用两个条件:(A,B) 可稳定;(A,Q1/2) 可检测。后者的含义是存在矩阵 L,使 A−LQ1/2 为 Hurwitz;等价地,以 Q1/2x 为输出时,全部不可观模态自身稳定。它比可观测性弱。

在这些条件下,连续代数 Riccati 方程

ATP+PA−PBR−1BTP+Q=0

有唯一对称半正定稳定解 P,其中“稳定解”指 A−BR−1BTP 为 Hurwitz。最优反馈与最优值为

u∗=−Kx,K=R−1BTP,infuJ(u;x0)=x0TPx0.

一般存在性结论引用 MIT 16.323 讲义 4–10;本页随后自包含地验证正定 Q 下的最优性证书,并完整计算一个实例。唯一性针对对称半正定稳定解;方程还可能有其他代数解,且最优 P 可以仅为半正定。

直觉

极点配置先指定衰减模式,LQR 则先指定偏差与用力的价格。Q 惩罚哪些状态方向,R 决定各输入通道的成本;最优反馈由这两种价格和动力学共同决定。稳定只是行为约束之一,不能单凭“极点更负”判断代价更低。

代价中 xTQx=‖Q1/2x‖2,因此 Q1/2 像一个评估性能的输出矩阵,通常与实际传感器 C 不同。可检测性要求:在整个演化过程中始终不进入代价观测的模态,必须自身稳定。它排除的是不可观的不稳定模态,而一个瞬时落在 ker⁡Q 中的方向,仍可能经动力学进入受惩罚的坐标。

例如双积分器 A=(0100) 若只惩罚位置,即 Q=diag(1,0),虽有 Qe2=0,却有 Q1/2eAte2=(t,0)T。初速度随后变成位置偏差,因而能被代价观测;堆叠 Q1/2 与 Q1/2A 得到的观测矩阵仍有秩二。这个方向无需自行衰减,可检测性也照样成立。

固定初态后,状态是输入的仿射函数,非负二次积分体现凸优化结构,优化变量则是一整条输入函数。沿轨道配平方,可以直接建立适用于这些输入的最优性证书。

例子与边界

配平方与终端项的极限 ​

设已经找到对称半正定 P 满足 Riccati 方程,且对应闭环稳定。令 V(x)=xTPx、K=R−1BTP,沿任一轨道几乎处处有

xTQx+uTRu=−dV(x)dt+(u+Kx)TR(u+Kx).

所以在有限 T 上,

JT=V(x0)−V(x(T))+∫0T(u+Kx)TR(u+Kx)dt.

要用这个恒等式比较无穷时域代价,关键是证明 V(x(T))→0。若 Q≻0,任一有限代价输入满足 x,u∈L2(0,∞),故 x′=Ax+Bu∈L2。绝对连续性与 Cauchy–Schwarz 不等式给出

‖x(t)−x(s)‖≤|t−s|‖x′‖L2(0,∞),

所以 x 一致连续。若 x(t) 不趋零,就能找到趋向无穷的一列时刻,范数均至少为某个 ε>0;一致连续性使每个时刻附近一个固定宽度区间内范数至少为 ε/2。抽取互不相交的区间会使 ∫‖x‖2 发散,矛盾。因此 x(t)→0,从而 V(x(T))→0。

取极限即得 J≥V(x0),无限代价输入也满足此下界。反馈 u=−Kx 的闭环稳定,状态、输入指数衰减,平方项恒零,于是达到 J=V(x0)。这证明了正定 Q 的验证结论。对一般半正定 Q,有限代价只直接控制 Q1/2x,终端极限还要利用可检测性;这部分由前述一般定理保证。

双积分器的最优增益与代价 ​

取

A=(0100),B=(01),Q=(1002),R=1.

该输入对可控,Q1/2=diag(1,2) 满秩,故上述条件成立。写 P=(pqqr),Riccati 方程逐项成为

1−q2=0,p−qr=0,2q+2−r2=0.

若 q=−1,则 r=p=0,所得矩阵不定。若 q=1,则 r=±2,p=r;负号给出负定矩阵,半正定分支只能是

P=(2112),K=(1 2).

P 的特征值为 1,3。闭环 A−BK=(01−1−2) 的特征多项式为 (s+1)2,虽有非平凡 Jordan 块,仍为 Hurwitz。前述配平方证明因 Q≻0 而完全适用。

当 x0=e1,解为

x1(t)=(1+t)e−t,x2(t)=−te−t,u(t)=(t−1)e−t.

于是

J=∫0∞(2+4t2)e−2tdt=2⋅12+4⋅14=2=e1TPe1.

比较极点配置增益 Kpp=(2 3),仍使用同一 Q,R。令 App=A−BKpp,直接相乘可验证

H=(9/45/45/49/4),AppTH+HApp+Q+KppTKpp=0.

沿稳定闭环,ddt(xTHx)=−xT(Q+KppTKpp)x。积分且利用 x(t)→0,得到 Jpp(e1)=e1THe1=9/4>2。因此 −1,−2 两个稳定极点并没有胜过 LQR 的两个 −1;比较的依据是完整代价,而非谱的排序。

条件缺失时会怎样 ​

取标量 A=B=R=1,Q=0。系统可稳定,但成本观察完全看不见不稳定状态,故不可检测。u=0 的成本为零,状态却发散。Riccati 方程 2P−P2=0 有 P=0 与 P=2;前者给不稳定的最优控制,后者给稳定反馈却有成本 2x02。缺少可检测性时,不能把稳定 Riccati 分支直接称作所有输入中的最优解。

另一方面,A=−1,B=0,Q=0,R=1 满足可稳定与可检测条件,最优解却是 P=0。这说明一般定理只保证半正定,正定性需要更强条件。

推论与应用

这个单元的三个数有不同含义:有限时域从零到 (1,0) 的最小输入能量是 12;无限时域从 (1,0) 调节到零的 LQR 代价是 2;同样权重下指定极点反馈的代价是 9/4。初末条件、时域和目标函数都必须一起写明,数字才可比较。

物理传感器不足、输入有约束或系统受噪声驱动时,需要相应的估计、约束优化或随机控制模型。离散时间 Kalman 递推中的 Riccati 方程描述估计误差协方差,这里的连续时间方程则描述控制的最优价值;二者的对象和时间模型各有明确含义。

参考资料
  • Jonathan How,MIT 16.323,Spring 2008,讲义日期 2008-06-18,Lecture 4: Linear Quadratic Regulators,4–8 至 4–10,无限时域 CARE、可稳定与可检测条件及半正定解。
  • Stephen Boyd,Stanford EE363,Winter 2008–09,Lecture 4: Continuous-time Linear Quadratic Regulator,4–7 至 4–10 的二次价值函数推导,4–21 至 4–23 的无限时域方程。该稿的反馈符号与本文约定不同,本文统一采用 u=−Kx。
关系图谱16 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具