形式陈述
给定实常矩阵 A , B 与初态 x 0 ,考虑连续时间系统 x ′ = A x + B u 。输入取局部平方可积函数,状态为相应绝对连续解,允许无限代价。无限时域 LQR 在所有这些输入中最小化
J ( u ; x 0 ) = ∫ 0 ∞ ( x T Q x + u T R u ) d t , Q = Q T ⪰ 0 , R = R T ≻ 0. 这里无终点约束、无输入饱和,也无噪声;全状态可用于状态反馈 公理库 线性状态反馈与稳定化 Linear state feedback · 线性反馈稳定化 用全状态反馈改变闭环谱,证明单输入可控系统的极点配置,并区分可控与可稳定。 。一般存在性定理采用两个条件:( A , B ) 可稳定;( A , Q 1 / 2 ) 可检测。后者的含义是存在矩阵 L ,使 A − L Q 1 / 2 为 Hurwitz;等价地,以 Q 1 / 2 x 为输出时,全部不可观模态自身稳定。它比可观测性 公理库 线性系统的可观测性 Observability of a linear system · Kalman 可观测性秩判据 由已知输入和无噪声输出轨迹判断初始状态能否唯一辨别,并用 Gramian 重建初态。 弱。
在这些条件下,连续代数 Riccati 方程
A T P + P A − P B R − 1 B T P + Q = 0 有唯一对称半正定稳定解 P ,其中“稳定解”指 A − B R − 1 B T P 为 Hurwitz。最优反馈与最优值为
u ∗ = − K x , K = R − 1 B T P , inf u J ( u ; x 0 ) = x 0 T P x 0 . 一般存在性结论引用 MIT 16.323 讲义 4–10;本页随后自包含地验证正定 Q 下的最优性证书,并完整计算一个实例。唯一性针对对称半正定稳定解;方程还可能有其他代数解,且最优 P 可以仅为半正定。
直觉
极点配置先指定衰减模式,LQR 则先指定偏差与用力的价格。Q 惩罚哪些状态方向,R 决定各输入通道的成本;最优反馈由这两种价格和动力学共同决定。稳定只是行为约束之一,不能单凭“极点更负”判断代价更低。
代价中 x T Q x = ‖ Q 1 / 2 x ‖ 2 ,因此 Q 1 / 2 像一个评估性能的输出矩阵,通常与实际传感器 C 不同。可检测性要求:在整个演化过程中始终不进入代价观测的模态,必须自身稳定。它排除的是不可观的不稳定模态,而一个瞬时落在 ker Q 中的方向,仍可能经动力学进入受惩罚的坐标。
例如双积分器 A = ( 0 1 0 0 ) 若只惩罚位置,即 Q = diag ( 1 , 0 ) ,虽有 Q e 2 = 0 ,却有 Q 1 / 2 e A t e 2 = ( t , 0 ) T 。初速度随后变成位置偏差,因而能被代价观测;堆叠 Q 1 / 2 与 Q 1 / 2 A 得到的观测矩阵仍有秩二。这个方向无需自行衰减,可检测性也照样成立。
固定初态后,状态是输入的仿射函数,非负二次积分体现凸优化 公理库 凸优化问题 Convex optimization problem 在凸可行域上最小化凸目标且不等式约束为凸函数的优化模型。 结构,优化变量则是一整条输入函数。沿轨道配平方,可以直接建立适用于这些输入的最优性证书。
例子与边界
配平方与终端项的极限
设已经找到对称半正定 P 满足 Riccati 方程,且对应闭环稳定。令 V ( x ) = x T P x 、K = R − 1 B T P ,沿任一轨道几乎处处有
x T Q x + u T R u = − d V ( x ) d t + ( u + K x ) T R ( u + K x ) . 所以在有限 T 上,
J T = V ( x 0 ) − V ( x ( T ) ) + ∫ 0 T ( u + K x ) T R ( u + K x ) d t . 要用这个恒等式比较无穷时域代价,关键是证明 V ( x ( T ) ) → 0 。若 Q ≻ 0 ,任一有限代价输入满足 x , u ∈ L 2 ( 0 , ∞ ) ,故 x ′ = A x + B u ∈ L 2 。绝对连续性与 Cauchy–Schwarz 不等式给出
‖ x ( t ) − x ( s ) ‖ ≤ | t − s | ‖ x ′ ‖ L 2 ( 0 , ∞ ) , 所以 x 一致连续。若 x ( t ) 不趋零,就能找到趋向无穷的一列时刻,范数均至少为某个 ε > 0 ;一致连续性使每个时刻附近一个固定宽度区间内范数至少为 ε / 2 。抽取互不相交的区间会使 ∫ ‖ x ‖ 2 发散,矛盾。因此 x ( t ) → 0 ,从而 V ( x ( T ) ) → 0 。
取极限即得 J ≥ V ( x 0 ) ,无限代价输入也满足此下界。反馈 u = − K x 的闭环稳定,状态、输入指数衰减,平方项恒零,于是达到 J = V ( x 0 ) 。这证明了正定 Q 的验证结论。对一般半正定 Q ,有限代价只直接控制 Q 1 / 2 x ,终端极限还要利用可检测性;这部分由前述一般定理保证。
双积分器的最优增益与代价
取
A = ( 0 1 0 0 ) , B = ( 0 1 ) , Q = ( 1 0 0 2 ) , R = 1. 该输入对可控,Q 1 / 2 = diag ( 1 , 2 ) 满秩,故上述条件成立。写 P = ( p q q r ) ,Riccati 方程逐项成为
1 − q 2 = 0 , p − q r = 0 , 2 q + 2 − r 2 = 0. 若 q = − 1 ,则 r = p = 0 ,所得矩阵不定。若 q = 1 ,则 r = ± 2 , p = r ;负号给出负定矩阵,半正定分支只能是
P = ( 2 1 1 2 ) , K = ( 1 2 ) . P 的特征值为 1 , 3 。闭环 A − B K = ( 0 1 − 1 − 2 ) 的特征多项式为 ( s + 1 ) 2 ,虽有非平凡 Jordan 块,仍为 Hurwitz。前述配平方证明因 Q ≻ 0 而完全适用。
当 x 0 = e 1 ,解为
x 1 ( t ) = ( 1 + t ) e − t , x 2 ( t ) = − t e − t , u ( t ) = ( t − 1 ) e − t . 于是
J = ∫ 0 ∞ ( 2 + 4 t 2 ) e − 2 t d t = 2 ⋅ 1 2 + 4 ⋅ 1 4 = 2 = e 1 T P e 1 . 比较极点配置增益 K pp = ( 2 3 ) ,仍使用同一 Q , R 。令 A pp = A − B K pp ,直接相乘可验证
H = ( 9 / 4 5 / 4 5 / 4 9 / 4 ) , A pp T H + H A pp + Q + K pp T K pp = 0. 沿稳定闭环,d d t ( x T H x ) = − x T ( Q + K pp T K pp ) x 。积分且利用 x ( t ) → 0 ,得到 J pp ( e 1 ) = e 1 T H e 1 = 9 / 4 > 2 。因此 − 1 , − 2 两个稳定极点并没有胜过 LQR 的两个 − 1 ;比较的依据是完整代价,而非谱的排序。
条件缺失时会怎样
取标量 A = B = R = 1 , Q = 0 。系统可稳定,但成本观察完全看不见不稳定状态,故不可检测。u = 0 的成本为零,状态却发散。Riccati 方程 2 P − P 2 = 0 有 P = 0 与 P = 2 ;前者给不稳定的最优控制,后者给稳定反馈却有成本 2 x 0 2 。缺少可检测性时,不能把稳定 Riccati 分支直接称作所有输入中的最优解。
另一方面,A = − 1 , B = 0 , Q = 0 , R = 1 满足可稳定与可检测条件,最优解却是 P = 0 。这说明一般定理只保证半正定,正定性需要更强条件。
推论与应用
这个单元的三个数有不同含义:有限时域从零到 ( 1 , 0 ) 的最小输入能量是 12 ;无限时域从 ( 1 , 0 ) 调节到零的 LQR 代价是 2 ;同样权重下指定极点反馈的代价是 9 / 4 。初末条件、时域和目标函数都必须一起写明,数字才可比较。
物理传感器不足、输入有约束或系统受噪声驱动时,需要相应的估计、约束优化或随机控制模型。离散时间 Kalman 递推中的 Riccati 方程描述估计误差协方差,这里的连续时间方程则描述控制的最优价值;二者的对象和时间模型各有明确含义。
参考资料