形式陈述
给定实矩阵 A ∈ R n × n 、B ∈ R n × m ,离散系统为
x k + 1 = A x k + B u k . 它的无约束有限时域线性二次调节问题,是对给定 x 0 与整数 N ≥ 1 最小化
J N = ∑ k = 0 N − 1 ( x k T Q x k + u k T R u k ) + x N T P f x N , Q , P f ⪰ 0 , R ≻ 0. 状态完全可用,采用负反馈 理路 线性状态反馈与稳定化 Linear state feedback · 线性反馈稳定化 用全状态反馈改变闭环谱,证明单输入可控系统的极点配置,并区分可控与可稳定。 约定 u k = − K k x k 。有限时域不要求开环稳定,也不要求可控;输入不受约束且 R ≻ 0 ,已足以给出唯一最优输入序列。
离散稳定指矩阵为 Schur ,即所有特征值模严格小于 1 。称 ( A , B ) 可稳定,若某个 K s 使 A − B K s 为 Schur;称 ( A , C ) 可检测,若某个 L 使 A − L C 为 Schur。这些定义借用反馈与输出注入的同一种矩阵形式,但稳定区域是单位圆内;连续时间可检测性页 理路 线性系统的可观测性 Observability of a linear system · Kalman 可观测性秩判据 用观测 Gramian 重建初态,再分离不可观子空间,证明可检测性与稳定输出注入的等价关系。 的 Hurwitz 条件不能直接代入这里。下文直接在 Schur 假设下证明所需结论。
在 ( A , B ) 可稳定、( A , Q 1 / 2 ) 可检测时,离散代数 Riccati 方程(DARE)
(1) P = Q + A T P A − A T P B ( R + B T P B ) − 1 B T P A 有唯一对称半正定解。其增益
K = ( R + B T P B ) − 1 B T P A 使 A − B K 为 Schur,且无限时域最优值为 x 0 T P x 0 。下面先处理精确采样,再证明有限递推与这一有限维稳定极限。
例子与边界
精确保持采样也要变换成本
设连续常系数系统 理路 线性常微分方程组 Linear system of ordinary differential equations 形如 x′=A(t)x+b(t) 的向量值一阶线性方程组。 为 x ˙ = A c x + B c u ,采样周期 h > 0 ,且 u ( t ) = u k 在 [ k h , ( k + 1 ) h ) 上保持不变。常数变易公式给出
x ( k h + τ ) = Φ ( τ ) x k + Γ ( τ ) u k , Φ ( τ ) = e A c τ , Γ ( τ ) = ∫ 0 τ e A c s B c d s . 因此 A = Φ ( h ) 、B = Γ ( h ) 是精确的采样动力学,不需要 A c 可逆。若连续阶段成本是 x T Q c x + u T R c u ,则同一段的积分恰好等于
x k T Q d x k + 2 x k T M d u k + u k T R d u k , 其中
(2) ( Q d M d M d T R d ) = ∫ 0 h ( Φ Γ 0 I ) T ( Q c 0 0 R c ) ( Φ Γ 0 I ) d τ . 若 Q c ⪰ 0 , R c ≻ 0 ,这个块矩阵半正定,且 R d ⪰ h R c ≻ 0 。通常 M d ≠ 0 。例如 x ˙ = u 、Q c = R c = 1 ,直接积分得
∫ 0 h [ ( x + τ u ) 2 + u 2 ] d τ = h x 2 + h 2 x u + ( h + h 3 / 3 ) u 2 . 当 h = 1 时,A = B = 1 ,但权重是 Q d = 1 , M d = 1 / 2 , R d = 4 / 3 。直接沿用 Q = R = 1 , M = 0 会得到另一个离散目标。式 (2) 的等价范围是指定周期的保持输入族,不能据此宣称其最优值等于允许任意连续输入的最优值。
带交叉项时可令 v = u + R d − 1 M d T x ,将阶段成本写成
x T Q ~ x + v T R d v , Q ~ = Q d − M d R d − 1 M d T ⪰ 0 , 并把动力学改成 x + = A ~ x + B v ,其中 A ~ = A − B R d − 1 M d T 。无约束时这是输入序列的一一变换;应用下述稳定定理须核对变换后数据的可稳定与可检测条件。若输入有约束,约束也必须随变量变换,不能直接丢掉交叉项。
有限时域的配平方证书
设 P N = P f 。对 k = N − 1 , … , 0 ,依次计算
(3) H k = R + B T P k + 1 B , K k = H k − 1 B T P k + 1 A , P k = Q + A T P k + 1 A − A T P k + 1 B H k − 1 B T P k + 1 A . 这里 H k ≻ 0 。直接展开右端,得到对任意 x , u 成立的恒等式
(4) x T Q x + u T R u + ( A x + B u ) T P k + 1 ( A x + B u ) = x T P k x + ( u + K k x ) T H k ( u + K k x ) . 左端取关于 u 的最小值得到非负函数,故 P k ⪰ 0 ;唯一最小点是 u = − K k x 。这既证明逆推合法,也给出二次凸优化 理路 凸优化问题 Convex optimization problem 在凸可行域上最小化凸目标且不等式约束为凸函数的优化模型。 的逐步解。
沿任意可行轨迹求和,状态价值项逐项抵消:
(5) J N = x 0 T P 0 x 0 + ∑ k = 0 N − 1 ( u k + K k x k ) T H k ( u k + K k x k ) . 所有平方项同时为零恰好给出反馈序列,因此它全局最优且唯一。这份证书比较所有输入序列,不限于预先假定的线性反馈。
例如 A = B = Q = R = 1 , N = 2 , P f = 0 ,递推为
P 2 = 0 , K 1 = 0 , P 1 = 1 , K 0 = 1 2 , P 0 = 3 2 . 初值 x 0 = 3 时,u 0 = − 3 / 2 , u 1 = 0 ,状态为 3 , 3 / 2 , 3 / 2 ,总成本是 27 / 2 。若后来施加 | u k | ≤ 1 ,这份序列就不可行,需要转入约束问题。
对状态维数 n ≥ 1 、输入维数 m ≥ 1 ,按稠密经典矩阵运算计,式 (3) 的一个逆推步需要 O ( n 3 + n 2 m + n m 2 + m 3 ) 次算术运算;实现可对 H k 作分解并解线性方程,无需显式形成逆矩阵。除给定模型数据外,工作存储为 O ( n 2 + n m + m 2 ) 个数;若保留全部 N 个反馈增益,还需 O ( N m n ) 个数。实施一次已存增益 u = − K k x 需要 O ( m n ) 次算术运算。这里另计数值精度与位成本;下文无限时域极限的存在证明本身不给出达到指定容差的统一迭代次数。
零终端有限价值怎样收敛到DARE
用 S j 表示终端权重为零、还剩 j 步时的价值矩阵。式 (3) 给出 S 0 = 0 和 S j + 1 = R ( S j ) 。阶段成本非负,所以任一 j + 1 步序列的前 j 步成本至少为 j 步最优值,从而
0 ⪯ S j ⪯ S j + 1 . 取一个稳定反馈 K s ,记 F s = A − B K s 。由于 F s 为 Schur,矩阵级数
W s = ∑ k = 0 ∞ ( F s k ) T ( Q + K s T R K s ) F s k 收敛。有限最优成本不超过该反馈的无限成本,故 S j ⪯ W s 。对每个 x ,x T S j x 由单调有界序列定理 理路 单调有界序列收敛定理 Monotone convergence theorem for sequences 每个单调且有界的实数序列都收敛。 收敛;通过极化取出每个矩阵元,有限维中得到 S j → P ⪰ 0 。因为 R + B T S j B ⪰ R ≻ 0 ,求逆在极限处连续,递推的极限就是式 (1)。
再证明相应闭环 F = A − B K 稳定。配平方给出
(6) P − F T P F = Q + K T R K . 若 F v = λ v 且 v ≠ 0 , | λ | ≥ 1 ,在复向量上计算得
( 1 − | λ | 2 ) v ∗ P v = ‖ Q 1 / 2 v ‖ 2 + ‖ R 1 / 2 K v ‖ 2 . 左端非正、右端非负,因此右端为零:Q 1 / 2 v = 0 , K v = 0 。于是 A v = λ v ,并对可检测性给出的 L 有 ( A − L Q 1 / 2 ) v = λ v ,与该矩阵 Schur 矛盾。因此 F 的全部特征值模小于 1 。
无限时域最优性与半正定权重
取任意有限成本输入序列,则 u k 与 C x k 平方可和,其中 C = Q 1 / 2 ,所以两者都趋于零。利用可检测性,把状态写成
x k + 1 = ( A − L C ) x k + g k , g k = B u k + L C x k ⟶ 0. Schur 矩阵 F o = A − L C 满足 ‖ F o j ‖ ≤ M ρ j ,其中 0 < ρ < 1 。公式
x k = F o k x 0 + ∑ i = 0 k − 1 F o k − 1 − i g i 说明 x k → 0 :固定有限个早期 g i 的贡献分别衰减;其余 g i 可统一足够小,而矩阵范数几何级数的和有限。因而 x k T P x k → 0 。
把定常版本的式 (4) 累加到 N − 1 ,再令 N → ∞ ,便得
J ∞ = x 0 T P x 0 + ∑ k = 0 ∞ ( u k + K x k ) T ( R + B T P B ) ( u k + K x k ) ≥ x 0 T P x 0 . 无限成本输入自然也满足下界。稳定反馈 u = − K x 令平方项全为零并具有有限成本,故达到该值。若另有半正定 DARE 解,同一个特征向量论证使其闭环稳定,再由相同价值证书得出相同二次最优值;极化说明两个矩阵相等。这完成存在、稳定、最优性与半正定解唯一性。
黄金比解及必要的条件
对 A = B = Q = R = 1 ,DARE 变成
P = 1 + P − P 2 1 + P , P 2 − P − 1 = 0. 半正定解为 P = φ = ( 1 + 5 ) / 2 ,并且
K = φ 1 + φ = 1 φ , F = 1 − K = 1 φ 2 . 负根不是半正定解。沿最优轨道 x k = φ − 2 k x 0 ,几何级数给出
J ∞ = 1 + φ − 2 1 − φ − 4 x 0 2 = φ x 0 2 , 可与 DARE 价值独立对照。
缺少可检测性时结论会改变。取 A = 2 , B = R = 1 , Q = 0 ,DARE 有 P = 0 , 3 ;P = 0 对应零成本的最优输入 u = 0 ,状态发散,P = 3 对应稳定反馈 K = 3 / 2 ,却对非零初态花费正成本。稳定分支不再等于所有输入中的最优分支。另一方面,A = 1 / 2 , B = 0 , Q = 0 , R = 1 满足两条件,最优 P = 0 ;一般结论确实只能保证半正定。