形式陈述
给定实常矩阵 A , B 与初态 x 0 ,考虑连续时间系统 x ′ = A x + B u 。输入取局部平方可积函数,状态为相应绝对连续解,允许无限代价。无限时域 LQR 在所有这些输入中最小化
J ( u ; x 0 ) = ∫ 0 ∞ ( x T Q x + u T R u ) d t , Q = Q T ⪰ 0 , R = R T ≻ 0. 这里无终点约束、无输入饱和,也无噪声;全状态可用于状态反馈 公理库 线性状态反馈与稳定化 Linear state feedback · 线性反馈稳定化 用全状态反馈改变闭环谱,证明单输入可控系统的极点配置,并区分可控与可稳定。 。一般存在性定理采用两个条件:( A , B ) 可稳定;( A , Q 1 / 2 ) 可检测。后者的含义是存在矩阵 L ,使 A − L Q 1 / 2 为 Hurwitz;等价地,以 Q 1 / 2 x 为输出时,全部不可观模态自身稳定。它比可观测性 公理库 线性系统的可观测性 Observability of a linear system · Kalman 可观测性秩判据 用观测 Gramian 重建初态,再分离不可观子空间,证明可检测性与稳定输出注入的等价关系。 弱。
在这些条件下,连续代数 Riccati 方程
A T P + P A − P B R − 1 B T P + Q = 0 有唯一对称半正定稳定解 P ,其中“稳定解”指 A − B R − 1 B T P 为 Hurwitz。最优反馈与最优值为
u ∗ = − K x , K = R − 1 B T P , inf u J ( u ; x 0 ) = x 0 T P x 0 . 本页从有限时域构造这个解。令 G = B R − 1 B T ,以剩余时长 s 为自变量的 Riccati 方程为
(1) d S d s = A T S + S A − S G S + Q , S ( 0 ) = 0. 其解对所有 s ≥ 0 存在,且 S ( s ) ⪰ 0 、随 s 按半正定序单调增加,并收敛到上述 P 。有限时域 [ 0 , T ] 、自由终态、零终端代价的价值是 x 0 T S ( T ) x 0 ,最优反馈在时刻 t 使用 S ( T − t ) 。不能把正向剩余时长方程 (1) 与反向终端条件的符号混用。
下面证明全部结论,包括 Q 仅半正定时的存在、稳定、最优及唯一性。一般最优矩阵可以有零特征值,CARE 也可能存在其他非半正定代数解。
直觉
极点配置先指定衰减模式,LQR 则先指定偏差与用力的价格。Q 惩罚哪些状态方向,R 决定各输入通道的成本;最优反馈由这两种价格和动力学共同决定。稳定只是行为约束之一,不能单凭“极点更负”判断代价更低。
代价中 x T Q x = ‖ Q 1 / 2 x ‖ 2 ,因此 Q 1 / 2 像一个评估性能的输出矩阵,通常与实际传感器 C 不同。可检测性要求:在整个演化过程中始终不进入代价观测的模态,必须自身稳定。它排除的是不可观的不稳定模态,而一个瞬时落在 ker Q 中的方向,仍可能经动力学进入受惩罚的坐标。
例如双积分器 A = ( 0 1 0 0 ) 若只惩罚位置,即 Q = diag ( 1 , 0 ) ,虽有 Q e 2 = 0 ,却有 Q 1 / 2 e A t e 2 = ( t , 0 ) T 。初速度随后变成位置偏差,因而能被代价观测;堆叠 Q 1 / 2 与 Q 1 / 2 A 得到的观测矩阵仍有秩二。这个方向无需自行衰减,可检测性也照样成立。
固定初态后,状态是输入的仿射函数。以几乎处处相等识别局部平方可积输入,非负二次积分在这个实向量空间上定义取值于 [ 0 , ∞ ] 的凸函数 公理库 凸函数 Convex function 函数在任意凸组合处不超过相同权重下函数值的凸组合。 。优化变量是一整条输入函数,因此这里使用的是函数空间上的凸性,不能直接把整个问题当成有限维二次规划。沿轨道配平方,可以直接建立适用于这些输入的最优性证书。
例子与边界
一个始终保留零方向的极限
取
A = ( 0 0 0 − 2 ) , B = ( 1 0 ) , Q = ( 1 0 0 0 ) , R = 1. 第二状态既不可控,也不被代价观察,但它自行衰减,所以可稳定与可检测条件都满足。系统与代价按两个坐标分离,(1) 的解为
S ( T ) = ( tanh T 0 0 0 ) . 直接验证:p ( T ) = tanh T 满足 p ′ = 1 − p 2 、p ( 0 ) = 0 ,其他矩阵分量恒为零。因此
S ( T ) ↑ P = ( 1 0 0 0 ) , K = ( 1 0 ) , A − B K = diag ( − 1 , − 2 ) . 无限时域最优控制为 u = − x 1 ,最优值为 x 1 , 0 2 ,与初始第二坐标无关。半正定 P 并不妨碍整个闭环稳定。
图片加载失败 半正定价值矩阵的单调极限 图中蓝线是实际函数 tanh T ,虚线为极限一;红线是始终为零的第二特征值。矩阵按半正定序增加,极限仍有零方向,而对应闭环的两个极点均严格为负。
有限时域反馈为 u ( t ) = − tanh ( T − t ) x 1 ( t ) ,解为
x 1 ( t ) = x 1 , 0 cosh ( T − t ) cosh T , u ( t ) = − x 1 , 0 sinh ( T − t ) cosh T . 积分 cosh 2 s + sinh 2 s = cosh ( 2 s ) ,确得
J T = x 1 , 0 2 sinh ( 2 T ) 2 cosh 2 T = x 1 , 0 2 tanh T . 有限时域在终点停止计费,所以 x 1 ( T ) = x 1 , 0 / cosh T 不必为零。这与固定终点的最小能量问题有不同边界条件。
双积分器的最优增益与代价
取
A = ( 0 1 0 0 ) , B = ( 0 1 ) , Q = ( 1 0 0 2 ) , R = 1. 该输入对可控,Q 1 / 2 = diag ( 1 , 2 ) 满秩,故上述条件成立。写 P = ( p q q r ) ,Riccati 方程逐项成为
1 − q 2 = 0 , p − q r = 0 , 2 q + 2 − r 2 = 0. 若 q = − 1 ,则 r = p = 0 ,所得矩阵不定。若 q = 1 ,则 r = ± 2 , p = r ;负号给出负定矩阵,半正定分支只能是
P = ( 2 1 1 2 ) , K = ( 1 2 ) . P 的特征值为 1 , 3 。闭环 A − B K = ( 0 1 − 1 − 2 ) 的特征多项式为 ( s + 1 ) 2 ,虽有非平凡 Jordan 块,仍为 Hurwitz。下文的一般证明在这里适用;本例的 Q 还额外正定。
当 x 0 = e 1 ,解为
x 1 ( t ) = ( 1 + t ) e − t , x 2 ( t ) = − t e − t , u ( t ) = ( t − 1 ) e − t . 于是
J = ∫ 0 ∞ ( 2 + 4 t 2 ) e − 2 t d t = 2 ⋅ 1 2 + 4 ⋅ 1 4 = 2 = e 1 T P e 1 . 比较极点配置增益 K pp = ( 2 3 ) ,仍使用同一 Q , R 。令 A pp = A − B K pp ,直接相乘可验证
H = ( 9 / 4 5 / 4 5 / 4 9 / 4 ) , A pp T H + H A pp + Q + K pp T K pp = 0. 沿稳定闭环,d d t ( x T H x ) = − x T ( Q + K pp T K pp ) x 。积分且利用 x ( t ) → 0 ,得到 J pp ( e 1 ) = e 1 T H e 1 = 9 / 4 > 2 。因此 − 1 , − 2 两个稳定极点并没有胜过 LQR 的两个 − 1 ;比较的依据是完整代价,而非谱的排序。
条件缺失时会怎样
取标量 A = B = R = 1 , Q = 0 。系统可稳定,但成本观察完全看不见不稳定状态,故不可检测。u = 0 的成本为零,状态却发散。Riccati 方程 2 P − P 2 = 0 有 P = 0 与 P = 2 ;前者给不稳定的最优控制,后者给稳定反馈却有成本 2 x 0 2 。缺少可检测性时,不能把稳定 Riccati 分支直接称作所有输入中的最优解。
另一方面,A = − 1 , B = 0 , Q = 0 , R = 1 满足可稳定与可检测条件,最优解却是 P = 0 。这说明一般定理只保证半正定,正定性需要更强条件。
推论与应用
有限时域:先局部求解,再以代价界延拓
(1) 的右侧是矩阵元素的多项式,由Picard–Lindelöf 定理 公理库 Picard–Lindelöf 存在唯一性定理 Picard-Lindelof theorem · Cauchy-Lipschitz theorem 连续且对状态变量局部一致 Lipschitz 的向量场给出常微分方程初值问题的唯一局部解。 ,从零初值有唯一局部解;对称性由转置后满足同一方程及唯一性保持。在它存在的任意 [ 0 , h ] 内,令
Π h ( t ) = S ( h − t ) , K h ( t ) = R − 1 B T Π h ( t ) . 对任意 u ∈ L 2 ( [ 0 , h ] ) ,状态绝对连续 公理库 绝对连续函数 Absolutely continuous function · Absolute continuity on an interval 把有限组总长度很小的区间送到总振幅很小的函数类,并满足 Lebesgue 版微积分基本定理。 ,乘积求导和配平方几乎处处成立:
x T Q x + u T R u = − d d t ( x T Π h ( t ) x ) + ( u + K h ( t ) x ) T R ( u + K h ( t ) x ) . 因为 Π h ( h ) = 0 ,积分得到
(2) J h ( u ; x 0 ) = x 0 T S ( h ) x 0 + ∫ 0 h ( u + K h ( t ) x ) T R ( u + K h ( t ) x ) d t . 连续的时变反馈 u = − K h ( t ) x 使平方项为零,线性方程的解存在且输入属于 L 2 ,所以确实达到右侧下界。代价非负,故 S ( h ) ⪰ 0 。这一步没有先假设最优解存在。
由可稳定性,选 K 0 使 F 0 = A − B K 0 为 Hurwitz。它的无限代价矩阵
H = ∫ 0 ∞ e F 0 T t ( Q + K 0 T R K 0 ) e F 0 t d t 有限且半正定。把 u = − K 0 x 限制到 [ 0 , h ] ,其有限代价不超过 x 0 T H x 0 。由 (2) 的最小性,对所有存在时长都有
(3) 0 ⪯ S ( h ) ⪯ H . 因此 S 始终留在一个有界闭矩阵集合中,局部 Lipschitz 常微分方程不可能在有限正时间逃逸,解可延拓到所有 h ≥ 0 。
单调有界怎样推出 CARE
若 h 2 ≥ h 1 ,任意 [ 0 , h 2 ] 输入的前 h 1 段代价至少为该短时域的最优值,而后段代价非负。对长时域输入取下确界,得到
对 每 个 x T S ( h 1 ) x ≤ x T S ( h 2 ) x 对每个 x . 结合 (3),先在整数时长上对每个二次型应用单调有界序列定理 公理库 单调有界序列收敛定理 Monotone convergence theorem for sequences 每个单调且有界的实数序列都收敛。 ;任意实数时长夹在相邻整数之间,由单调性得到同一极限。用 x = e i 得到对角元收敛,用
2 S i j ( h ) = ( e i + e j ) T S ( h ) ( e i + e j ) − S i i ( h ) − S j j ( h ) 得到其余矩阵元也收敛。有限维中这给出矩阵范数极限 S ( h ) → P ⪰ 0 。
仅有函数收敛,不能直接断言导数趋零。这里还要使用方程:多项式右侧的连续性给出
S ′ ( h ) ⟶ A T P + P A − P G P + Q . 若右侧某个元素非零,对应导数最终保持同号且绝对值有正下界,该元素就不可能收敛。于是整个极限为零,P 满足 CARE。
可检测性排除不稳定特征向量
写 C Q = Q 1 / 2 、K = R − 1 B T P 、F = A − B K 。CARE 等价于
(4) F T P + P F = − Q − K T R K . 若 F v = λ v ,其中 v ≠ 0 可以为复向量,且 Re λ ≥ 0 ,则
2 Re λ v ∗ P v = − ‖ C Q v ‖ 2 − ‖ R 1 / 2 K v ‖ 2 . 左侧非负、右侧非正,只能同时为零。因此 C Q v = 0 且 K v = 0 ,进而 A v = F v = λ v 。可检测性给出某个 L 使 A − L C Q 稳定,但它仍把 v 映为 λ v ,矛盾。因此 F 为 Hurwitz。这个证明只用了 P ⪰ 0 ,没有把它擅自加强为正定。
无限时域最优性与稳定解唯一性
对任意局部平方可积输入,包括无限代价输入,非负积分及 (2) 给出
J ( u ; x 0 ) ≥ J h ( u ; x 0 ) ≥ x 0 T S ( h ) x 0 . 令 h → ∞ ,得到 J ( u ; x 0 ) ≥ x 0 T P x 0 。这份下界证明无需先证明任意候选输入的状态趋零。
对所构造的反馈 u ∗ = − K x ,闭环已证明稳定,故 x ( t ) 与 u ∗ ( t ) 指数衰减。沿它积分 (4),得到
J h ( u ∗ ; x 0 ) = x 0 T P x 0 − x ( h ) T P x ( h ) . 末项趋零,故它达到下界。最优输入按几乎处处相等唯一:若两份有限代价最优输入不同,取平均时状态也取平均,R ≻ 0 使输入二次积分严格下降,而状态二次项凸,违反最优性。
最后,设 P 1 , P 2 是两个对称稳定 CARE 解,记 D = P 1 − P 2 、F i = A − G P i 。相减整理得
F 1 T D + D F 2 = 0. 所以 e F 1 T t D e F 2 t 的导数为零,始终等于 D ;但两指数都趋零,又迫使 D = 0 。稳定对称解因而唯一。前面的特征向量论证适用于任意半正定 CARE 解,所以在可检测假设下,所有半正定解都稳定,也就只有这一份。
三种代价与输出实现
这个单元的三个数有不同含义:在一单位时间内从零到 ( 1 , 0 ) 的最小输入能量是 12 ;无限时域从 ( 1 , 0 ) 调节到零的 LQR 代价是 2 ;同样权重下指定极点反馈的代价是 9 / 4 。初末条件、时域和目标函数都必须一起写明,数字才可比较。
基于观测器的输出反馈 公理库 基于观测器的输出反馈与分离原理 Observer-based output feedback · Separation principle in linear control 用输出创新驱动全阶观测器,在状态与估计误差坐标中证明块三角分离,复算双积分器四极点及估计暂态的额外代价。 在只测位置时动态补出速度估计,并以块三角矩阵证明稳定性。未知初态下的估计暂态仍会增加成本,稳定分离不意味着保持全状态已知时的最优代价。输入有约束或系统受噪声驱动时,还需要相应的约束优化或随机控制模型。离散时间 Kalman 递推中的 Riccati 方程描述估计误差协方差,这里的连续时间方程则描述控制的最优价值;二者的对象和时间模型各有明确含义。
离散时间 LQR 公理库 离散时间线性二次调节器 Discrete-time linear quadratic regulator · Discrete-time LQR 从保持输入的精确采样出发,用有限时域配平方及稳定DARE解构造离散二次最优反馈。 从区间内保持输入出发,同时精确离散化动力学与积分成本;成本通常出现状态—输入交叉项,不能只替换状态矩阵后沿用原权重。该页再从有限 Riccati 递推证明稳定 DARE 极限,并复算标量黄金比解。加入输入约束后,模型预测控制 公理库 模型预测控制与终端证书 Model predictive control · Receding-horizon control · 滚动时域控制 将受约束线性预测写成二次规划,用终端不变性和成本下降证明滚动执行的递归可行与收敛。 将每次预测写成二次规划,以值 14 的两步计划展示饱和成本,再用终端不变性与移位候选证明递归可行及价值下降。
参考资料