Skip to content

方法Method

HAC协方差估计与Bartlett窗口

HAC covariance estimation · Newey–West covariance estimator · Bartlett HAC estimator

将按时间排列的得分转成半正定Bartlett长期协方差,证明有限窗口恒等式,并在明确的高斯有限MA模型下完成一致性、均值标准误与失败诊断。

形式陈述 ​

相邻误差相关时,把每行得分平方后相加会漏掉跨时点的共同波动。Sandwich协方差已经给出从得分波动到参数波动的定标;本页接手其中的中间矩阵,用自协方差的共同分母约定实际计算时间相关的部分。HAC指异方差与自相关一致协方差估计;这里固定使用Bartlett权重,不把名称当作无条件保证。

输入、输出和单位 ​

输入是按时间排列的实向量 s1,…,sn∈Rp,n≥1、p≥1,以及整数最大滞后 0≤L≤n−1。先明确 st究竟是原始拟合得分,还是已经减去样本均值的得分;算法不会偷偷改变这一选择。用共同分母 n定义

Γ^k=1n∑t=k+1nstst−kT,0≤k<n,(1)B^L=Γ^0+∑k=1L(1−kL+1)(Γ^k+Γ^kT).

B^L估计的是根号样本量下的得分和协方差,不是样本平均本身的方差。若还给出平均估计方程的非奇异敏感度 A^,输出参数协方差及固定对比 c的标准误

(2)C^=1nA^−1B^LA^−T,se^(cTθ^)=cTC^c.

必须同时报告 n,L、时间单位、中心化选择、共同分母、敏感度的平均/求和约定和失败状态。L=0退回同一得分约定下的逐行外积;A^奇异时不能用广义逆悄悄替代普通参数推断。

有限样本半正定:所有输入都成立 ​

在 1,…,n之外令 st=0。对 j=1,…,n+L定义长度 L+1的窗口和

bj=∑a=0Lsj−a.

展开 ∑jbjbjT。同一个 ststT被包含在 L+1个窗口中;相距 k≤L的有序观测对被包含在 L+1−k个窗口中;距离更远的观测对没有共同窗口。因此

(3)B^L=1n(L+1)∑j=1n+LbjbjT.

任取 v∈Rp,右侧二次型是 [n(L+1)]−1∑j(vTbj)2≥0,所以矩阵半正定。这个证明不要求独立、正态、平稳,也不要求输入是真得分;拟合残差同样适用。它只证明代数合法性,既不保证正定,也不保证估计了正确总体。逐滞后改除以 n−k会破坏这个具体恒等式。

直觉

一个冲击可能连续推动好几个时点的估计。短窗口先把这些推力相加,再看窗口和的平方,保留了近邻的交叉项。距离越近,共享窗口越多,最终权重越大;Bartlett的三角形权重因此来自“共同出现多少次”,不是任意削小远期数值。

增加 L会纳入更多滞后,也会累积更多估计噪声;它不是越大越保险。实际依赖是否衰减、观测是否等间隔、被估目标是否稳定,都属于模型问题。把样本排序只完成输入排列,不能证明这些条件。

有限均值方差和长期目标分开 ​

对零均值弱平稳标量得分 Xt,沿用有效样本量中的有限均值方差恒等式,

(4)nVar(X¯n)=γ(0)+2∑k=1n−1(1−kn)γ(k).

这里 n−k是相距 k的观测对数量。若 ∑k≥0|γ(k)|<∞,式(4)趋于 Ω=γ(0)+2∑k≥1γ(k)。这个结论只涉及二阶矩极限;绝对可和本身不推出中心极限定理。式(1)用估计协方差与带宽 L逼近长期目标,不能把它说成已知总体协方差下的有限 n精确式(4)。

例子与边界

三个残差足以识别错误窗口 ​

取 s=(1,−2,1),n=3,L=1。它们的平均为零,故这次是否再次中心化不影响答案。共同分母给

γ^0=2,γ^1=−4/3,γ^2=1/3.

只保留前一个滞后但不加权,得到 2+2(−4/3)=−2/3,不能作为方差。Bartlett一阶权重为 1/2,所以

B^1=2+2(1/2)(−4/3)=2/3.

四个补零窗口和是 (1,−1,−1,1),平方和为4,除以 n(L+1)=6再次得到 2/3。若这是均值方程 st=Yt−μ^,则 A^=−1,均值方差估计为 2/9,SE为 2/3。三点算术通过不等于三点正态区间的覆盖已经获证。

共同分母同样不可省略。对 (1,−2,2,−1),n=4,L=1,γ^0=5/2、γ^1=−2,Bartlett给 1/2。若一阶改除以 n−1=3,该项变成 −8/3,相同权重却给 5/2−8/3=−1/6。

一组可从头证明的充分条件 ​

现在换成明确总体。设 q为固定非负整数,a0,…,aq为固定实数,σ2>0,∑j=0qaj≠0。对所有整数 t,创新 εt独立同分布为 N(0,σ2),观察

Yt=μ+Xt,Xt=∑j=0qajεt−j,1≤t≤n.

这是有限移动平均模型的高斯独立创新版本,比只有跨期不相关的白噪声强。令 μ^=Y¯n,输入中心化残差 st=Yt−Y¯n;取确定性整数带宽 Ln→∞、Ln=o(n),并满足 Ln≤n−1。例如 min(n−1,⌊n1/3⌋)可用。则

(5)B^Ln→PΩ=σ2(∑j=0qaj)2>0,Y¯n−μB^Ln/n⇒N(0,1).

这是本页实际证明的统计保证。系数、阶数固定与高斯独立创新都不能在应用时悄悄去掉;这里没有要求MA可逆,因为只估均值和长期方差。

证明的第一步:已知中心时的随机误差。 γ(k)=0对 |k|>q成立。令 γ~k=n−1∑t=k+1nXtXt−k,则 Eγ~k=(1−k/n)γ(k)。中心高斯变量满足

(6)Cov(XtXt−k,XuXu−k)=γ(t−u)2+γ(t−u+k)γ(t−u−k).

这项四阶等式可将 X展开为独立创新验证:只出现两两配对的指标;同一个创新四次出现时 Eε4=3σ4,恰对应三种配对;再减去乘积均值就剩式(6)。因此无需额外引用一般依赖数据定理。

对固定 t,式(6)第一项只有至多 2q+1个 u非零,第二项也至多 2q+1个。用 |γ(k)|≤γ(0)得到对所有 k<n统一成立的界

Var(γ~k)≤Cn,C=2(2q+1)γ(0)2.

于是各滞后误差绝对值的期望不超过 C/n,式(1)的加权误差期望不超过 (1+2Ln)C/n→0,故依概率趋零。确定性均值部分只有 k≤q的有限项;Ln→∞使每一权重趋1,1−k/n→1,所以趋于 Ω。

第二步:估计中心的额外误差。 记 Qn=n−1∑tXt2。逐滞后展开 st=Xt−X¯n,Cauchy–Schwarz给

|γ^k−γ~k|≤2|X¯n|Qn+X¯n2.

EQn=γ(0)使 Qn=OP(1);式(4)及有限 q给 X¯n=OP(n−1/2)。对至多 Ln个滞后累加,中心化影响为 OP(Ln/n)=oP(1),完成 B^Ln的一致性。这个步骤显式处理了所有残差共享同一个拟合均值,不能把拟合后残差当成IID观测。

第三步:正态校准。 样本均值是独立高斯创新的线性组合,故由多元正态的线性变换,它在每个 n都精确正态。式(4)给 nVar(Y¯n)→Ω>0;再用Slutsky定理和方差插件一致性得到式(5)。这证明渐近学生化;随机分母的有限样本比值并未被证明为正态或Student t。若有限样本分母为零,实际程序应报区间失败;该事件概率随一致性趋零。为让理论随机序列处处有定义,可在该事件上赋任意固定有限值,这种延拓不改变极限。

同一MA(1)的三种方差 ​

取 a0=1,a1=1/2,σ2=1。则 γ(0)=5/4、γ(1)=1/2、Ω=9/4,而

Var(Y¯n)=54n+n−1n2.

在 n=4时,精确方差为 1/2;错误的IID尺度为 5/16;长期近似 Ω/n=9/16。在 n=10和100时,精确值分别为 43/200和 14/625。独立复核方法是直接累计每个创新在均值中的系数平方:端点系数为 1/(2n)和 1/n,其余 n−1个系数为 3/(2n),平方和同样为上述精确式。

即使知道只有一个非零滞后,也不能把Bartlett的 L=1永远固定:当 n→∞,它趋于 5/4+2(1/2)(1/2)=7/4,不是 9/4。遗漏的 1/2来自固定权重的收缩,不是遗漏了未知高阶滞后。若改为 a1=−1/2,长期方差变成 1/4<5/4;HAC标准误不一定比IID标准误大。

推论与应用

回归只替换中间矩阵,仍需证明中心和极限 ​

对按时序排列的回归得分 st=ztu^t,平均方程敏感度为 A^=−H/n,H=∑tztztT。令

ML=∑tststT+∑k=1L(1−kL+1)∑t=k+1n(stst−kT+st−kstT).

由于 B^L=ML/n,式(2)精确等于 H−1MLH−1,不能再除以 n。这说明如何从旧的求和正规方程接入,而不是重新发明OLS。

统计传播须另有依据:若已建立 n(θ^−θ0)=−A−1n−1/2∑tψt(θ0)+oP(1)、依赖得分CLT给协方差 B,且 A^→PA非奇异、拟合后 B^L→PB,才可由式(2)和Slutsky得到正对比方差下的渐近区间。上面的均值MA证明没有替一般回归验证这些假设。得分均值非零、内生性、根选错或模型结构突变,都不会被换一个协方差矩阵修复。

聚类稳健估计依赖很多独立群;本页利用时间顺序和滞后衰减。把整条时间序列随意当成一个群既不提供独立重复,也不等于HAC。

从计算到可审计报告 ​

直接按滞后累计式(1)需 O(n(L+1)p2)工作。式(3)可先维护一个长度 L+1的滚动和,每次增减一个向量,累积窗口外积,工作为 O(np2+np);已存输入时额外空间为 O(p2+p),真正流式输入还需 O(Lp)环形缓存。敏感度求解另需 O(p3),模型拟合成本另计。一般实现应解线性方程,避免显式求逆;小型精确reader用有理数消元方便核对。

标准库复算器同时计算滞后式和窗口式,检查维数、带宽、中心化、对称性、半正定证书、敏感度可逆性及对比方差。精确算术给出 LDLT半正定证书;浮点展示另报Jacobi迭代的最小特征值估计、最终非对角残差半径和单独的负值容差;它们不严格界定舍入误差,不能替代精确证书,也不能用截成零掩盖明显负值。超出浮点范围或下溢时,仅保留精确结果并标明展示失败。输出将算术状态与“依赖CLT、平稳性等模型条件未由样本认证”分列。

冻结的预测规则产生的平稳损失或损失差序列,可以在合适依赖模型下使用同一均值接口。滚动起点验证若每次改变训练集或重选模型,损失序列未必平稳;仅仅按时间合法回放,不能直接援用本页固定MA均值证明。可在原可用推断验收的HAC选读题完成复算、换模型迁移和失效定位。

带宽来源不可混用 ​

Newey–West的1987原文式(5)以 m表示最大滞后,因此对应本页 L=m;其Theorem 2在特定高阶矩、混合速率、光滑包络和根号样本量插件条件下要求 m=o(n1/4)。本页没有调用该一般定理,而给出有限高斯MA的独立证明与较窄模型下 L=o(n)的充分条件。

Stock–Watson第二版§15.4式(15.16)只加到 m−1,权重 1−k/m,所以它的 m=L+1。该书式(15.17)的 m≈0.75n1/3是带模型动机的实践基准;它不满足原文Theorem 2的 o(n1/4)条件,不能拿来替那一定理补条件。固定样本应明报所取整数及敏感性检查,不能仅写“用了Newey–West默认值”。

自测。 ∑jaj=0会怎样?答案:长期方差为零,式(5)的正分母极限失效;有限均值仍可能有更快收敛,不能据此沿用普通根号样本量学生化。保留 L固定、改用硬截断、得分均值非零、损失发生结构突变,分别破坏一致目标、半正定保证、中心条件、平稳依赖模型,不能统一写成“样本太小”。

参考资料
  • Whitney K. Newey and Kenneth D. West,A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix,Econometrica 55(3), 1987,pp.703–708;p.704式(5)与Theorem 1为Bartlett构造及半正定性,p.705 Theorem 2与pp.706–707证明给特定混合条件的带宽要求。本页窗口计数证明和有限高斯MA证明完整写出,不声称覆盖原文所有模型。
  • James H. Stock and Mark W. Watson,Introduction to Econometrics,实际文件为第二版扫描件,§15.4,印刷pp.606–609(PDF第633–636页);式(15.16)使用 m−1个滞后,式(15.17)讨论实务带宽。网址文件名的“3e”不作为版次依据。
关系图谱14 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系