形式陈述
对均值为 μ 的弱平稳过程 公理库 弱平稳过程 Weakly stationary process · Covariance-stationary process · 二阶平稳过程 均值不随时间改变、协方差只取决于时间差且具有有限二阶矩的随机过程。 ( X t ) ,自协方差函数定义为
γ ( h ) = Cov ( X t + h , X t ) = E [ ( X t + h − μ ) ( X t − μ ) ] , h ∈ Z . 弱平稳性保证右侧与基准时刻 t 无关。实值过程满足 γ ( − h ) = γ ( h ) 、| γ ( h ) | ≤ γ ( 0 ) ,且 γ ( 0 ) 就是过程方差。更关键的约束是非负定性:任取整数 t 1 , … , t n 和实数 a 1 , … , a n ,
∑ i , j = 1 n a i a j γ ( t i − t j ) = Var ( ∑ i = 1 n a i X t i ) ≥ 0. 反过来,任意偶、实值、非负定函数都可作为某个零均值弱平稳过程的自协方差;例如可构造相应高斯过程。有限样本常用估计量 γ ^ ( h ) = n − 1 ∑ t = 1 n − | h | ( X t + | h | − X ¯ ) ( X t − X ¯ ) 。分母取 n 时整组估计形成半正定 Toeplitz 结构;取 n − | h | 可减轻某些偏差,却未必保持联合半正定。
直觉
γ ( h ) 把一条无限协方差矩阵压缩成按对角线编号的一列数。正值表示相隔 h 期的偏差倾向同向,负值表示倾向反向,接近零只说明线性二阶关联弱。量纲是原变量单位的平方,所以不同量纲或不同方差的序列不能直接比较自协方差大小;这种比较应转向归一化的相关系数。
自协方差并非“看一眼曲线后计算相似度”。期望是对过程重复实现取平均,单条观测只给估计。大滞后可用乘积项变少,估计噪声自然增大;与此同时,不同滞后的估计值彼此相关。把每个 γ ^ ( h ) 当独立、同精度的数字会低估不确定性。函数衰减快慢描述冲击在线性预测中的记忆,但慢衰减可能来自长记忆、单位根或未去趋势,三者需要模型条件区分。
例子与边界
令 ε t 为均值 0 、方差 4 、跨期不相关的白噪声,并取
X t = ε t + 1 2 ε t − 1 . 则 E X t = 0 ,展开乘积可复算
γ ( 0 ) = 4 + 1 4 ⋅ 4 = 5 , γ ( 1 ) = E [ ( ε t + 1 + 1 2 ε t ) ( ε t + 1 2 ε t − 1 ) ] = 2 , 而 | h | ≥ 2 时两式没有共同创新,故 γ ( h ) = 0 。例如 ( X t , X t + 1 ) 的协方差矩阵为 ( 5 2 2 5 ) ,特征值 7 , 3 均非负;这直接检查了候选数值的可实现性。若随手声称 γ ( 0 ) = 1 , γ ( 1 ) = 2 ,二维矩阵行列式 1 − 4 < 0 ,它不可能是任何过程的自协方差。
边界上,γ ( h ) = 0 不推出独立,除非再有联合高斯等条件。确定性常数过程的 γ 恒为零,却不是随机噪声;方差无穷的稳定分布过程则根本没有传统自协方差。对非平稳过程,应写两参数协方差 C ( s , t ) ;强行把不同 t 的值按相同滞后平均,会把随时间改变的方差误装成一个函数。
推论与应用
当 γ ( 0 ) > 0 时,除以它得到自相关函数 公理库 自相关函数 Autocorrelation function · ACF 将自协方差按零滞后方差归一化后得到的无量纲滞后依赖函数。 ρ ( h ) ,保留形状并消去尺度。自协方差还直接给有限过去的最佳线性预测:预测系数由包含 γ ( 0 ) , … , γ ( p ) 的 Toeplitz 正规方程确定。对自回归模型,这些关系化为Yule–Walker 方程 公理库 Yule–Walker 方程 Yule–Walker equations · Yule-Walker equations 将平稳自回归系数与自协方差联系起来的 Toeplitz 线性方程组。 ;对一般纯非确定弱平稳过程,Wold 分解 公理库 Wold 分解定理 Wold decomposition theorem · Wold representation theorem 将弱平稳过程唯一拆为由创新驱动的单边线性部分与可由无限过去预测的确定部分。 说明同一 γ 可由白噪声的线性滤波表示。
若 ∑ h | γ ( h ) | < ∞ ,谱密度
f ( λ ) = 1 2 π ∑ h ∈ Z γ ( h ) e − i h λ 连续且非负,反演积分恢复 γ ( h ) 。这把时域的滞后记忆转成频域的功率分配。样本设计中,均值 X ¯ n 的方差为 n − 2 ∑ s , t γ ( s − t ) ;正相关会降低有效信息量,负相关可能提高它。因此“有 n 个时点”并不等于拥有 n 个独立样本。
参考资料
Peter J. Brockwell and Richard A. Davis, Time Series: Theory and Methods , 2nd ed., Springer, 1991,§1.5 and Proposition 1.5.1,autocovariance functions and nonnegative definiteness。
Peter J. Brockwell and Richard A. Davis, Introduction to Time Series and Forecasting , 3rd ed., Springer, 2016,§§1.4.1 and 2.4.2,sample and population ACVF/ACF。
Robert H. Shumway and David S. Stoffer, Time Series Analysis and Its Applications , 4th ed., Springer, 2017,§1.3,autocovariance and autocorrelation functions。