形式陈述
相邻误差相关时,把每行得分平方后相加会漏掉跨时点的共同波动。Sandwich协方差 理路 Sandwich 协方差估计 Sandwich covariance estimation 从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。 已经给出从得分波动到参数波动的定标;本页接手其中的中间矩阵,用自协方差的共同分母约定 理路 自协方差函数 Autocovariance function · ACVF 以滞后为自变量记录弱平稳过程两个时点之间协方差的函数。 实际计算时间相关的部分。HAC指异方差与自相关一致协方差估计;这里固定使用Bartlett权重,不把名称当作无条件保证。
输入、输出和单位
输入是按时间排列的实向量 s 1 , … , s n ∈ R p ,n ≥ 1 、p ≥ 1 ,以及整数最大滞后 0 ≤ L ≤ n − 1 。先明确 s t 究竟是原始拟合得分,还是已经减去样本均值的得分;算法不会偷偷改变这一选择。用共同分母 n 定义
Γ ^ k = 1 n ∑ t = k + 1 n s t s t − k T , 0 ≤ k < n , (1) B ^ L = Γ ^ 0 + ∑ k = 1 L ( 1 − k L + 1 ) ( Γ ^ k + Γ ^ k T ) . B ^ L 估计的是根号样本量下的得分和协方差,不是样本平均本身的方差。若还给出平均估计方程的非奇异敏感度 A ^ ,输出参数协方差及固定对比 c 的标准误
(2) C ^ = 1 n A ^ − 1 B ^ L A ^ − T , se ^ ( c T θ ^ ) = c T C ^ c . 必须同时报告 n , L 、时间单位、中心化选择、共同分母、敏感度的平均/求和约定和失败状态。L = 0 退回同一得分约定下的逐行外积;A ^ 奇异时不能用广义逆悄悄替代普通参数推断。
有限样本半正定:所有输入都成立
在 1 , … , n 之外令 s t = 0 。对 j = 1 , … , n + L 定义长度 L + 1 的窗口和
b j = ∑ a = 0 L s j − a . 展开 ∑ j b j b j T 。同一个 s t s t T 被包含在 L + 1 个窗口中;相距 k ≤ L 的有序观测对被包含在 L + 1 − k 个窗口中;距离更远的观测对没有共同窗口。因此
(3) B ^ L = 1 n ( L + 1 ) ∑ j = 1 n + L b j b j T . 任取 v ∈ R p ,右侧二次型是 [ n ( L + 1 ) ] − 1 ∑ j ( v T b j ) 2 ≥ 0 ,所以矩阵半正定 理路 正定与半正定矩阵 Positive definite matrix · Positive semidefinite matrix · PSD matrix 由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。 。这个证明不要求独立、正态、平稳,也不要求输入是真得分;拟合残差同样适用。它只证明代数合法性,既不保证正定,也不保证估计了正确总体。逐滞后改除以 n − k 会破坏这个具体恒等式。
直觉
一个冲击可能连续推动好几个时点的估计。短窗口先把这些推力相加,再看窗口和的平方,保留了近邻的交叉项。距离越近,共享窗口越多,最终权重越大;Bartlett的三角形权重因此来自“共同出现多少次”,不是任意削小远期数值。
图片加载失败 增加 L 会纳入更多滞后,也会累积更多估计噪声;它不是越大越保险。实际依赖是否衰减、观测是否等间隔、被估目标是否稳定,都属于模型问题。把样本排序只完成输入排列,不能证明这些条件。
有限均值方差和长期目标分开
对零均值弱平稳标量得分 X t ,沿用有效样本量中的有限均值方差恒等式 理路 Monte Carlo 有效样本量 Effective sample size for Monte Carlo · Monte Carlo ESS · ESS 以方差匹配把权重集中或序列相关造成的信息损失折算成理想独立等权样本数的诊断量。 ,
(4) n Var ( X ¯ n ) = γ ( 0 ) + 2 ∑ k = 1 n − 1 ( 1 − k n ) γ ( k ) . 这里 n − k 是相距 k 的观测对数量。若 ∑ k ≥ 0 | γ ( k ) | < ∞ ,式(4)趋于 Ω = γ ( 0 ) + 2 ∑ k ≥ 1 γ ( k ) 。这个结论只涉及二阶矩极限;绝对可和本身不推出中心极限定理。式(1)用估计协方差与带宽 L 逼近长期目标,不能把它说成已知总体协方差下的有限 n 精确式(4)。
例子与边界
三个残差足以识别错误窗口
取 s = ( 1 , − 2 , 1 ) ,n = 3 , L = 1 。它们的平均为零,故这次是否再次中心化不影响答案。共同分母给
γ ^ 0 = 2 , γ ^ 1 = − 4 / 3 , γ ^ 2 = 1 / 3. 只保留前一个滞后但不加权,得到 2 + 2 ( − 4 / 3 ) = − 2 / 3 ,不能作为方差。Bartlett一阶权重为 1 / 2 ,所以
B ^ 1 = 2 + 2 ( 1 / 2 ) ( − 4 / 3 ) = 2 / 3. 四个补零窗口和是 ( 1 , − 1 , − 1 , 1 ) ,平方和为4,除以 n ( L + 1 ) = 6 再次得到 2 / 3 。若这是均值方程 s t = Y t − μ ^ ,则 A ^ = − 1 ,均值方差估计为 2 / 9 ,SE为 2 / 3 。三点算术通过不等于三点正态区间的覆盖已经获证。
共同分母同样不可省略。对 ( 1 , − 2 , 2 , − 1 ) ,n = 4 , L = 1 ,γ ^ 0 = 5 / 2 、γ ^ 1 = − 2 ,Bartlett给 1 / 2 。若一阶改除以 n − 1 = 3 ,该项变成 − 8 / 3 ,相同权重却给 5 / 2 − 8 / 3 = − 1 / 6 。
一组可从头证明的充分条件
现在换成明确总体。设 q 为固定非负整数,a 0 , … , a q 为固定实数,σ 2 > 0 ,∑ j = 0 q a j ≠ 0 。对所有整数 t ,创新 ε t 独立同分布为 N ( 0 , σ 2 ) ,观察
Y t = μ + X t , X t = ∑ j = 0 q a j ε t − j , 1 ≤ t ≤ n . 这是有限移动平均模型 理路 移动平均过程 Moving-average process · MA process 当前值由有限个当期与过去白噪声驱动项线性组合构成的时间序列模型。 的高斯独立创新版本,比只有跨期不相关的白噪声强。令 μ ^ = Y ¯ n ,输入中心化残差 s t = Y t − Y ¯ n ;取确定性整数带宽 L n → ∞ 、L n = o ( n ) ,并满足 L n ≤ n − 1 。例如 min ( n − 1 , ⌊ n 1 / 3 ⌋ ) 可用。则
(5) B ^ L n → P Ω = σ 2 ( ∑ j = 0 q a j ) 2 > 0 , Y ¯ n − μ B ^ L n / n ⇒ N ( 0 , 1 ) . 这是本页实际证明的统计保证。系数、阶数固定与高斯独立创新都不能在应用时悄悄去掉;这里没有要求MA可逆,因为只估均值和长期方差。
证明的第一步:已知中心时的随机误差。 γ ( k ) = 0 对 | k | > q 成立。令 γ ~ k = n − 1 ∑ t = k + 1 n X t X t − k ,则 E γ ~ k = ( 1 − k / n ) γ ( k ) 。中心高斯变量满足
(6) Cov ( X t X t − k , X u X u − k ) = γ ( t − u ) 2 + γ ( t − u + k ) γ ( t − u − k ) . 这项四阶等式可将 X 展开为独立创新验证:只出现两两配对的指标;同一个创新四次出现时 E ε 4 = 3 σ 4 ,恰对应三种配对;再减去乘积均值就剩式(6)。因此无需额外引用一般依赖数据定理。
对固定 t ,式(6)第一项只有至多 2 q + 1 个 u 非零,第二项也至多 2 q + 1 个。用 | γ ( k ) | ≤ γ ( 0 ) 得到对所有 k < n 统一成立的界
Var ( γ ~ k ) ≤ C n , C = 2 ( 2 q + 1 ) γ ( 0 ) 2 . 于是各滞后误差绝对值的期望不超过 C / n ,式(1)的加权误差期望不超过 ( 1 + 2 L n ) C / n → 0 ,故依概率趋零。确定性均值部分只有 k ≤ q 的有限项;L n → ∞ 使每一权重趋1,1 − k / n → 1 ,所以趋于 Ω 。
第二步:估计中心的额外误差。 记 Q n = n − 1 ∑ t X t 2 。逐滞后展开 s t = X t − X ¯ n ,Cauchy–Schwarz给
| γ ^ k − γ ~ k | ≤ 2 | X ¯ n | Q n + X ¯ n 2 . E Q n = γ ( 0 ) 使 Q n = O P ( 1 ) ;式(4)及有限 q 给 X ¯ n = O P ( n − 1 / 2 ) 。对至多 L n 个滞后累加,中心化影响为 O P ( L n / n ) = o P ( 1 ) ,完成 B ^ L n 的一致性。这个步骤显式处理了所有残差共享同一个拟合均值,不能把拟合后残差当成IID观测。
第三步:正态校准。 样本均值是独立高斯创新的线性组合,故由多元正态的线性变换 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ,它在每个 n 都精确正态。式(4)给 n Var ( Y ¯ n ) → Ω > 0 ;再用Slutsky定理 理路 Slutsky 定理 Slutsky's theorem 依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。 和方差插件一致性得到式(5)。这证明渐近学生化;随机分母的有限样本比值并未被证明为正态或Student t 。若有限样本分母为零,实际程序应报区间失败;该事件概率随一致性趋零。为让理论随机序列处处有定义,可在该事件上赋任意固定有限值,这种延拓不改变极限。
同一MA(1)的三种方差
取 a 0 = 1 , a 1 = 1 / 2 , σ 2 = 1 。则 γ ( 0 ) = 5 / 4 、γ ( 1 ) = 1 / 2 、Ω = 9 / 4 ,而
Var ( Y ¯ n ) = 5 4 n + n − 1 n 2 . 在 n = 4 时,精确方差为 1 / 2 ;错误的IID尺度为 5 / 16 ;长期近似 Ω / n = 9 / 16 。在 n = 10 和100时,精确值分别为 43 / 200 和 14 / 625 。独立复核方法是直接累计每个创新在均值中的系数平方:端点系数为 1 / ( 2 n ) 和 1 / n ,其余 n − 1 个系数为 3 / ( 2 n ) ,平方和同样为上述精确式。
即使知道只有一个非零滞后,也不能把Bartlett的 L = 1 永远固定:当 n → ∞ ,它趋于 5 / 4 + 2 ( 1 / 2 ) ( 1 / 2 ) = 7 / 4 ,不是 9 / 4 。遗漏的 1 / 2 来自固定权重的收缩,不是遗漏了未知高阶滞后。若改为 a 1 = − 1 / 2 ,长期方差变成 1 / 4 < 5 / 4 ;HAC标准误不一定比IID标准误大。
推论与应用
回归只替换中间矩阵,仍需证明中心和极限
对按时序排列的回归得分 s t = z t u ^ t ,平均方程敏感度为 A ^ = − H / n ,H = ∑ t z t z t T 。令
M L = ∑ t s t s t T + ∑ k = 1 L ( 1 − k L + 1 ) ∑ t = k + 1 n ( s t s t − k T + s t − k s t T ) . 由于 B ^ L = M L / n ,式(2)精确等于 H − 1 M L H − 1 ,不能再除以 n 。这说明如何从旧的求和正规方程接入,而不是重新发明OLS。
统计传播须另有依据:若已建立 n ( θ ^ − θ 0 ) = − A − 1 n − 1 / 2 ∑ t ψ t ( θ 0 ) + o P ( 1 ) 、依赖得分CLT给协方差 B ,且 A ^ → P A 非奇异、拟合后 B ^ L → P B ,才可由式(2)和Slutsky得到正对比方差下的渐近区间。上面的均值MA证明没有替一般回归验证这些假设。得分均值非零、内生性、根选错或模型结构突变,都不会被换一个协方差矩阵修复。
聚类稳健估计 理路 聚类稳健协方差估计 Cluster-robust covariance estimation · CR0 covariance 把独立群的总得分作为方差单位,计算回归 CR0 并识别少群、错误分组和秩不足的边界。 依赖很多独立群;本页利用时间顺序和滞后衰减。把整条时间序列随意当成一个群既不提供独立重复,也不等于HAC。
从计算到可审计报告
直接按滞后累计式(1)需 O ( n ( L + 1 ) p 2 ) 工作。式(3)可先维护一个长度 L + 1 的滚动和,每次增减一个向量,累积窗口外积,工作为 O ( n p 2 + n p ) ;已存输入时额外空间为 O ( p 2 + p ) ,真正流式输入还需 O ( L p ) 环形缓存。敏感度求解另需 O ( p 3 ) ,模型拟合成本另计。一般实现应解线性方程,避免显式求逆;小型精确reader用有理数消元方便核对。
标准库复算器 同时计算滞后式和窗口式,检查维数、带宽、中心化、对称性、半正定证书、敏感度可逆性及对比方差。精确算术给出 L D L T 半正定证书;浮点展示另报Jacobi迭代的最小特征值估计、最终非对角残差半径和单独的负值容差;它们不严格界定舍入误差,不能替代精确证书,也不能用截成零掩盖明显负值。超出浮点范围或下溢时,仅保留精确结果并标明展示失败。输出将算术状态与“依赖CLT、平稳性等模型条件未由样本认证”分列。
冻结的预测规则产生的平稳损失或损失差序列,可以在合适依赖模型下使用同一均值接口。滚动起点验证 理路 滚动起点验证与信息可用时间 Rolling-origin validation · Forecast-origin evaluation · 滚动预测起点评价 按每个预测起点当时真正可用的信息重建训练资料,分别核算预测步长、标签成熟时间、重叠窗口和多次重拟合成本。 若每次改变训练集或重选模型,损失序列未必平稳;仅仅按时间合法回放,不能直接援用本页固定MA均值证明。可在原可用推断验收的HAC选读题 完成复算、换模型迁移和失效定位。
带宽来源不可混用
Newey–West的1987原文式(5)以 m 表示最大滞后,因此对应本页 L = m ;其Theorem 2在特定高阶矩、混合速率、光滑包络和根号样本量插件条件下要求 m = o ( n 1 / 4 ) 。本页没有调用该一般定理,而给出有限高斯MA的独立证明与较窄模型下 L = o ( n ) 的充分条件。
Stock–Watson第二版§15.4式(15.16)只加到 m − 1 ,权重 1 − k / m ,所以它的 m = L + 1 。该书式(15.17)的 m ≈ 0.75 n 1 / 3 是带模型动机的实践基准;它不满足原文Theorem 2的 o ( n 1 / 4 ) 条件,不能拿来替那一定理补条件。固定样本应明报所取整数及敏感性检查,不能仅写“用了Newey–West默认值”。
自测。 ∑ j a j = 0 会怎样?答案:长期方差为零,式(5)的正分母极限失效;有限均值仍可能有更快收敛,不能据此沿用普通根号样本量学生化。保留 L 固定、改用硬截断、得分均值非零、损失发生结构突变,分别破坏一致目标、半正定保证、中心条件、平稳依赖模型,不能统一写成“样本太小”。
参考资料