Skip to content

方法Method

离散时间线性二次调节器

Discrete-time linear quadratic regulator · Discrete-time LQR · 离散Riccati方程 · Discrete algebraic Riccati equation

从保持输入的精确采样出发,用有限时域配平方及稳定DARE解构造离散二次最优反馈。

形式陈述 ​

给定实矩阵 A∈Rn×n、B∈Rn×m,离散系统为

xk+1=Axk+Buk.

它的无约束有限时域线性二次调节问题,是对给定 x0 与整数 N≥1 最小化

JN=∑k=0N−1(xkTQxk+ukTRuk)+xNTPfxN,Q,Pf⪰0,R≻0.

状态完全可用,采用负反馈约定 uk=−Kkxk。有限时域不要求开环稳定,也不要求可控;输入不受约束且 R≻0,已足以给出唯一最优输入序列。

离散稳定指矩阵为 Schur,即所有特征值模严格小于 1。称 (A,B) 可稳定,若某个 Ks 使 A−BKs 为 Schur;称 (A,C) 可检测,若某个 L 使 A−LC 为 Schur。这些条件对应连续控制中的可稳定与可检测接口,但稳定区域换成单位圆内。

在 (A,B) 可稳定、(A,Q1/2) 可检测时,离散代数 Riccati 方程(DARE)

(1)P=Q+ATPA−ATPB(R+BTPB)−1BTPA

有唯一对称半正定解。其增益

K=(R+BTPB)−1BTPA

使 A−BK 为 Schur,且无限时域最优值为 x0TPx0。下面先处理精确采样,再证明有限递推与这一有限维稳定极限。

直觉

连续控制允许随时改变输入;数字控制器常在每个采样区间保持输入不变。精确采样回答这一实现约束下的状态怎样变化,Riccati 递推回答未来状态偏差与控制消耗应怎样权衡。

有限时域价值函数从终端向前计算,而状态从初值向后执行。DARE 是时域不断延长后的价值固定点。这里的矩阵记录最优成本,并非滤波问题中的估计误差协方差。

例子与边界

精确保持采样也要变换成本 ​

设连续常系数系统为 x˙=Acx+Bcu,采样周期 h>0,且 u(t)=uk 在 [kh,(k+1)h) 上保持不变。常数变易公式给出

x(kh+τ)=Φ(τ)xk+Γ(τ)uk,Φ(τ)=eAcτ,Γ(τ)=∫0τeAcsBcds.

因此 A=Φ(h)、B=Γ(h) 是精确的采样动力学,不需要 Ac 可逆。若连续阶段成本是 xTQcx+uTRcu,则同一段的积分恰好等于

xkTQdxk+2xkTMduk+ukTRduk,

其中

(2)(QdMdMdTRd)=∫0h(ΦΓ0I)T(Qc00Rc)(ΦΓ0I)dτ.

若 Qc⪰0,Rc≻0,这个块矩阵半正定,且 Rd⪰hRc≻0。通常 Md≠0。例如 x˙=u、Qc=Rc=1,直接积分得

∫0h[(x+τu)2+u2]dτ=hx2+h2xu+(h+h3/3)u2.

当 h=1 时,A=B=1,但权重是 Qd=1,Md=1/2,Rd=4/3。直接沿用 Q=R=1,M=0 会得到另一个离散目标。式 (2) 的等价范围是指定周期的保持输入族,不能据此宣称其最优值等于允许任意连续输入的最优值。

带交叉项时可令 v=u+Rd−1MdTx,将阶段成本写成

xTQ~x+vTRdv,Q~=Qd−MdRd−1MdT⪰0,

并把动力学改成 x+=A~x+Bv,其中 A~=A−BRd−1MdT。无约束时这是输入序列的一一变换;应用下述稳定定理须核对变换后数据的可稳定与可检测条件。若输入有约束,约束也必须随变量变换,不能直接丢掉交叉项。

有限时域的配平方证书 ​

设 PN=Pf。对 k=N−1,…,0,依次计算

(3)Hk=R+BTPk+1B,Kk=Hk−1BTPk+1A,Pk=Q+ATPk+1A−ATPk+1BHk−1BTPk+1A.

这里 Hk≻0。直接展开右端,得到对任意 x,u 成立的恒等式

(4)xTQx+uTRu+(Ax+Bu)TPk+1(Ax+Bu)=xTPkx+(u+Kkx)THk(u+Kkx).

左端取关于 u 的最小值得到非负函数,故 Pk⪰0;唯一最小点是 u=−Kkx。这既证明逆推合法,也给出二次凸优化的逐步解。

沿任意可行轨迹求和,状态价值项逐项抵消:

(5)JN=x0TP0x0+∑k=0N−1(uk+Kkxk)THk(uk+Kkxk).

所有平方项同时为零恰好给出反馈序列,因此它全局最优且唯一。这份证书比较所有输入序列,不限于预先假定的线性反馈。

例如 A=B=Q=R=1,N=2,Pf=0,递推为

P2=0,K1=0,P1=1,K0=12,P0=32.

初值 x0=3 时,u0=−3/2,u1=0,状态为 3,3/2,3/2,总成本是 27/2。若后来施加 |uk|≤1,这份序列就不可行,需要转入约束问题。

零终端有限价值怎样收敛到DARE ​

用 Sj 表示终端权重为零、还剩 j 步时的价值矩阵。式 (3) 给出 S0=0 和 Sj+1=R(Sj)。阶段成本非负,所以任一 j+1 步序列的前 j 步成本至少为 j 步最优值,从而

0⪯Sj⪯Sj+1.

取一个稳定反馈 Ks,记 Fs=A−BKs。由于 Fs 为 Schur,矩阵级数

Ws=∑k=0∞(Fsk)T(Q+KsTRKs)Fsk

收敛。有限最优成本不超过该反馈的无限成本,故 Sj⪯Ws。对每个 x,xTSjx 单调有界;通过极化取出每个矩阵元,有限维中得到 Sj→P⪰0。因为 R+BTSjB⪰R≻0,求逆在极限处连续,递推的极限就是式 (1)。

再证明相应闭环 F=A−BK 稳定。配平方给出

(6)P−FTPF=Q+KTRK.

若 Fv=λv 且 v≠0,|λ|≥1,在复向量上计算得

(1−|λ|2)v∗Pv=‖Q1/2v‖2+‖R1/2Kv‖2.

左端非正、右端非负,因此右端为零:Q1/2v=0,Kv=0。于是 Av=λv,并对可检测性给出的 L 有 (A−LQ1/2)v=λv,与该矩阵 Schur 矛盾。因此 F 的全部特征值模小于 1。

无限时域最优性与半正定权重 ​

取任意有限成本输入序列,则 uk 与 Cxk 平方可和,其中 C=Q1/2,所以两者都趋于零。利用可检测性,把状态写成

xk+1=(A−LC)xk+gk,gk=Buk+LCxk⟶0.

Schur 矩阵 Fo=A−LC 满足 ‖Foj‖≤Mρj,其中 0<ρ<1。公式

xk=Fokx0+∑i=0k−1Fok−1−igi

说明 xk→0:固定有限个早期 gi 的贡献分别衰减;其余 gi 可统一足够小,而矩阵范数几何级数的和有限。因而 xkTPxk→0。

把定常版本的式 (4) 累加到 N−1,再令 N→∞,便得

J∞=x0TPx0+∑k=0∞(uk+Kxk)T(R+BTPB)(uk+Kxk)≥x0TPx0.

无限成本输入自然也满足下界。稳定反馈 u=−Kx 令平方项全为零并具有有限成本,故达到该值。若另有半正定 DARE 解,同一个特征向量论证使其闭环稳定,再由相同价值证书得出相同二次最优值;极化说明两个矩阵相等。这完成存在、稳定、最优性与半正定解唯一性。

黄金比解及必要的条件 ​

对 A=B=Q=R=1,DARE 变成

P=1+P−P21+P,P2−P−1=0.

半正定解为 P=φ=(1+5)/2,并且

K=φ1+φ=1φ,F=1−K=1φ2.

负根不是半正定解。沿最优轨道 xk=φ−2kx0,几何级数给出

J∞=1+φ−21−φ−4x02=φx02,

可与 DARE 价值独立对照。

缺少可检测性时结论会改变。取 A=2,B=R=1,Q=0,DARE 有 P=0,3;P=0 对应零成本的最优输入 u=0,状态发散,P=3 对应稳定反馈 K=3/2,却对非零初态花费正成本。稳定分支不再等于所有输入中的最优分支。另一方面,A=1/2,B=0,Q=0,R=1 满足两条件,最优 P=0;一般结论确实只能保证半正定。

推论与应用

连续时间LQR与本页分别使用 Hurwitz 和 Schur 稳定性;精确保持采样把二者的动力学连接起来,但输入族、阶段成本及交叉项仍须逐项对齐。有限时域的末步增益还可能为零,因此不能把一次有限计划的最后一步当作无限时域稳定控制。

模型预测控制在每个时刻重解带状态、输入和终端约束的有限问题。本页 DARE 的恒等式 (6) 可直接提供终端成本的下降证书;还需选取满足约束且在该反馈下不变的终端集。无约束 Riccati 解与受约束滚动优化由此有了可核验的接口。

验收练习。 先重算积分器的采样交叉项,再从 P2=0 得到 P0=3/2;最后标出 DARE 证明中可稳定性提供的上界,以及可检测性分别用于闭环谱与任意有限成本轨迹的两处位置。

参考资料
  • Stephen Boyd,Stanford EE363,Winter 2008–09,Lecture 1: Linear Quadratic Regulator—Discrete-time Finite Horizon,1–14至1–23、1–28:有限价值递推与稳态DARE。
  • William W. Hager and Larry L. Horowitz,Convergence and Stability Properties of the Discrete Riccati Operator Equation and the Associated Optimal Control and Filtering Problems,SIAM Journal on Control and Optimization 14(2),1976,§§2–3、Theorem 5、Appendix B,pp.296–298、305、309–310。本文给出零终端、有限维情形的单调极限与验证证明,不额外声称任意终端权重的收敛率。
  • MathWorks,Control System Toolbox 在线文档,lqrd: Algorithms,2026-10-05查阅:保持采样下动力学与完整块成本的离散化。
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系