Skip to content

方法Method

Hill 尾指数估计量

Hill estimator · Hill tail-index estimator

Hill 估计量平均最大的若干观测相对于随机门槛的对数比,估计正则变化重尾的形状,并显式面对门槛偏差。

形式陈述 ​

只使用最大的若干观测,怎样估计一个幂尾的指数?设 X1,…,Xn 为独立同分布的正数据,按次序统计量记为

X(1)≤⋯≤X(n).

假定总体右尾 F―(x)=x−1/ξL(x),ξ>0,其中 L 慢变化,即尾函数具有正则变化。对 1≤k<n,Hill 估计量是

ξ^k,n=1k∑j=1klog⁡X(n−j+1)X(n−k).

分子是最大的 k 个观测,分母是紧接着它们的第 k+1 大值,作为随机门槛。这里估计的是形状 ξ;若把幂尾写为 x−α,则 α=1/ξ,在 ξ^>0 时可用 α^=1/ξ^。并列值可能使最大的 k+1 个观测全相等,令 ξ^=0;此时没有有限的倒数估计。两种“尾指数”记法不能混用。

例如将一半概率放在 1,另一半取尾指数 α>0 的连续 Pareto 分布,所得尾仍正则变化;但所有 n 项都等于 1 的事件有概率 2−n>0,在这件事上 Hill 值就是零。

若 k=kn→∞ 且 kn/n→0,则 ξ^kn,n→ξ 依概率收敛。称这样的 kn 为中间次序:使用的尾部样本越来越多,但在全样本中的比例越来越小。一般的渐近正态结论还需要二阶尾条件。

把模型参数看成满足上述尾条件的总体分布 F,目标是其形状 ξ(F)。对固定 k,排序、正数比值和对数构成一个可测规则;取行动空间 [0,∞),例如配上平方损失,它就是这个目标的点估计量。

直觉

精确幂尾在对数坐标上变成指数尾。Hill 估计量因此就是高门槛以上对数超额的平均值。

选小 k,门槛高,更接近渐近幂尾,但估计波动大;选大 k,数据多,却可能把尚未进入幂尾的主体分布也拉进来。多看几个门槛是模型敏感性检查,不能把一段偶然平坦的曲线当作无偏保证。

例子与边界

八个数据的手算 ​

取排序后的样本

1, 1.2, 1.4, 1.8, 2, 3, 4, 8.

若 k=3,门槛是 X(5)=2,所以

ξ^3,8=log⁡(3/2)+log⁡(4/2)+log⁡(8/2)3=log⁡123≈0.8283.

对应 α^≈1.2073。若误把第三大值 3 当分母,就会把门槛推入已选的三个观测,改变估计量。

换 k=2,门槛三,得到 ξ^≈0.6343;换 k=4,门槛 1.8,得到 ξ^≈0.7266。三个结果并不相同。这份小样本只用于展示算式与门槛敏感性,不足以据此认证某个精确总体尾指数。

尺度不变,平移却会改变 ​

把全部数据乘正数 c,比值中的 c 抵消,Hill 估计量不变。把全部数据加上常数 b,则 log(X+b)/(u+b) 一般不等于 log⁡(X/u),有限样本估计会改变。

它也不是所有极值形状的通用估计量:负形状的有限端点、零形状的指数型吸引域都不满足本页 ξ>0 的目标模型。截断的幂尾在截断以下可能看起来很直,但最终不再具有无穷远正则变化尾。

推论与应用

从 Pareto 的对数超额得到估计量 ​

对精确 Pareto 模型 P(X>x)=x−1/ξ,x≥1,给定 X>u 后,

P(log⁡(X/u)>z∣X>u)=e−z/ξ,z≥0.

所以对数超额服从均值 ξ 的指数分布。对几乎每个随机门槛 X(n−k) 的取值,其上方 k 个数去掉排序后,条件联合分布可表示为独立的这种指数变量;排序不会改变它们的和。因此精确 Pareto 情形有

Eξ^k,n=ξ,Var(ξ^k,n)=ξ2k,

且 kξ^k,n/ξ 是 k 个率一指数变量之和。ξ^ 的无偏性不传给倒数:k>1 时 Eα^=αk/(k−1)。

一般正则变化下为什么仍一致 ​

令 U(t)=F←(1−1/t),则尾假设等价于 U∈RVξ。可以用标准 Pareto 变量 Yi(尾为 1/y)表示 Xi=dU(Yi)。设 Tn=Y(n−k),因 k/n→0,Tn→∞ 依概率。

给定 Tn 后,其上的未排序比值 Vj=Yi/Tn 仍是标准 Pareto 样本。Potter 界说明:对任意 ε>0,A>1,当 Tn 足够大时,全部 v≥1 都满足

|log⁡U(Tnv)U(Tn)−ξlog⁡v|≤log⁡A+εlog⁡v.

平均后,Hill 估计量与 ξk−1∑jlog⁡Vj 的差被 log⁡A+εk−1∑jlog⁡Vj 控制。这个条件样本的联合律不依赖门槛,所以该平均与一列固定的 IID 率一指数变量之前 k 项平均同分布。大数定律因而使它依概率趋向一。最后让 A↓1、ε↓0,便得到一致性。这个证明只需一阶正则变化,不要求二阶偏差已经比标准误小。

渐近正态为何多出偏差项 ​

一种标准二阶条件是:存在最终非零且符号固定的 A(t)→0、ρ≤0,使

U(tx)/U(t)−xξA(t)⟶xξxρ−1ρ,x>0,

ρ=0 时右侧取 xξlog⁡x。在这一二阶条件下,若中间次序还满足 kA(n/k)→λ∈R,则

k(ξ^k,n−ξ)⇒N(λ1−ρ,ξ2).

偏差常数可以从对数超额展开理解:二阶修正对标准 Pareto 比值的平均为

∫1∞vρ−1ρdvv2=11−ρ.

完整极限还须控制随机门槛和二阶余量;不能只凭这一个积分就省掉条件。估计量渐近正态在这里可能带非零中心。只有 λ=0 等偏差可忽略情形,才可直接使用以 ξ^ 为中心、标准误约为 ξ^/k 的通常近似。

参考资料
关系图谱25 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系