形式陈述
只使用最大的若干观测,怎样估计一个幂尾的指数?设 X 1 , … , X n 为独立同分布的正数据 公理库 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,按次序统计量 公理库 顺序统计量 Order statistic 有限样本按键排序后第 k 个位置的值,保留重复出现的次数。 记为
X ( 1 ) ≤ ⋯ ≤ X ( n ) . 假定总体右尾 F ― ( x ) = x − 1 / ξ L ( x ) ,ξ > 0 ,其中 L 慢变化,即尾函数具有正则变化 公理库 正则变化函数 Regularly varying function · Regular variation 正则变化以缩放比值的幂函数极限刻画幂律,允许不改变幂指数的慢变化修正。 。对 1 ≤ k < n ,Hill 估计量是
ξ ^ k , n = 1 k ∑ j = 1 k log X ( n − j + 1 ) X ( n − k ) . 分子是最大的 k 个观测,分母是紧接着它们的第 k + 1 大值,作为随机门槛。这里估计的是形状 ξ ;若把幂尾写为 x − α ,则 α = 1 / ξ ,在 ξ ^ > 0 时可用 α ^ = 1 / ξ ^ 。并列值可能使最大的 k + 1 个观测全相等,令 ξ ^ = 0 ;此时没有有限的倒数估计。两种“尾指数”记法不能混用。
例如将一半概率放在 1 ,另一半取尾指数 α > 0 的连续 Pareto 分布,所得尾仍正则变化;但所有 n 项都等于 1 的事件有概率 2 − n > 0 ,在这件事上 Hill 值就是零。
若 k = k n → ∞ 且 k n / n → 0 ,则 ξ ^ k n , n → ξ 依概率收敛 公理库 依概率收敛 Convergence in probability 随机变量偏离极限超过任意正阈值的概率趋于零。 。称这样的 k n 为中间次序:使用的尾部样本越来越多,但在全样本中的比例越来越小。一般的渐近正态结论还需要二阶尾条件。
把模型参数看成满足上述尾条件的总体分布 F ,目标是其形状 ξ ( F ) 。对固定 k ,排序、正数比值和对数构成一个可测规则;取行动空间 [ 0 , ∞ ) ,例如配上平方损失,它就是这个目标的点估计量 公理库 估计量、决策规则与风险 Estimator and decision rule · Statistical risk 从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。 。
直觉
精确幂尾在对数坐标上变成指数尾。Hill 估计量因此就是高门槛以上对数超额的平均值。
选小 k ,门槛高,更接近渐近幂尾,但估计波动大;选大 k ,数据多,却可能把尚未进入幂尾的主体分布也拉进来。多看几个门槛是模型敏感性检查,不能把一段偶然平坦的曲线当作无偏保证。
例子与边界
八个数据的手算
取排序后的样本
1 , 1.2 , 1.4 , 1.8 , 2 , 3 , 4 , 8. 若 k = 3 ,门槛是 X ( 5 ) = 2 ,所以
ξ ^ 3 , 8 = log ( 3 / 2 ) + log ( 4 / 2 ) + log ( 8 / 2 ) 3 = log 12 3 ≈ 0.8283 . 对应 α ^ ≈ 1.2073 。若误把第三大值 3 当分母,就会把门槛推入已选的三个观测,改变估计量。
换 k = 2 ,门槛三,得到 ξ ^ ≈ 0.6343 ;换 k = 4 ,门槛 1.8 ,得到 ξ ^ ≈ 0.7266 。三个结果并不相同。这份小样本只用于展示算式与门槛敏感性,不足以据此认证某个精确总体尾指数。
尺度不变,平移却会改变
把全部数据乘正数 c ,比值中的 c 抵消,Hill 估计量不变。把全部数据加上常数 b ,则 log ( X + b ) / ( u + b ) 一般不等于 log ( X / u ) ,有限样本估计会改变。
它也不是所有极值形状的通用估计量:负形状的有限端点、零形状的指数型吸引域都不满足本页 ξ > 0 的目标模型。截断的幂尾在截断以下可能看起来很直,但最终不再具有无穷远正则变化尾。
推论与应用
从 Pareto 的对数超额得到估计量
对精确 Pareto 模型 P ( X > x ) = x − 1 / ξ ,x ≥ 1 ,给定 X > u 后,
P ( log ( X / u ) > z ∣ X > u ) = e − z / ξ , z ≥ 0. 所以对数超额服从均值 ξ 的指数分布 公理库 指数分布 Exponential distribution 具有恒定失效率和连续无记忆性的非负等待时间分布。 。对几乎每个随机门槛 X ( n − k ) 的取值,其上方 k 个数去掉排序后,条件联合分布可表示为独立的这种指数变量;排序不会改变它们的和。因此精确 Pareto 情形有
E ξ ^ k , n = ξ , Var ( ξ ^ k , n ) = ξ 2 k , 且 k ξ ^ k , n / ξ 是 k 个率一指数变量之和。ξ ^ 的无偏性不传给倒数:k > 1 时 E α ^ = α k / ( k − 1 ) 。
一般正则变化下为什么仍一致
令 U ( t ) = F ← ( 1 − 1 / t ) ,则尾假设等价于 U ∈ R V ξ 。可以用标准 Pareto 变量 Y i (尾为 1 / y )表示 X i = d U ( Y i ) 。设 T n = Y ( n − k ) ,因 k / n → 0 ,T n → ∞ 依概率。
给定 T n 后,其上的未排序比值 V j = Y i / T n 仍是标准 Pareto 样本。Potter 界说明:对任意 ε > 0 , A > 1 ,当 T n 足够大时,全部 v ≥ 1 都满足
| log U ( T n v ) U ( T n ) − ξ log v | ≤ log A + ε log v . 平均后,Hill 估计量与 ξ k − 1 ∑ j log V j 的差被 log A + ε k − 1 ∑ j log V j 控制。这个条件样本的联合律不依赖门槛,所以该平均与一列固定的 IID 率一指数变量之前 k 项平均同分布。大数定律 公理库 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 因而使它依概率趋向一。最后让 A ↓ 1 、ε ↓ 0 ,便得到一致性。这个证明只需一阶正则变化,不要求二阶偏差已经比标准误小。
渐近正态为何多出偏差项
一种标准二阶条件是:存在最终非零且符号固定的 A ( t ) → 0 、ρ ≤ 0 ,使
U ( t x ) / U ( t ) − x ξ A ( t ) ⟶ x ξ x ρ − 1 ρ , x > 0 , ρ = 0 时右侧取 x ξ log x 。在这一二阶条件下,若中间次序还满足 k A ( n / k ) → λ ∈ R ,则
k ( ξ ^ k , n − ξ ) ⇒ N ( λ 1 − ρ , ξ 2 ) . 偏差常数可以从对数超额展开理解:二阶修正对标准 Pareto 比值的平均为
∫ 1 ∞ v ρ − 1 ρ d v v 2 = 1 1 − ρ . 完整极限还须控制随机门槛和二阶余量;不能只凭这一个积分就省掉条件。估计量渐近正态 公理库 估计量的渐近正态性 Asymptotic normality of estimators 估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。 在这里可能带非零中心。只有 λ = 0 等偏差可忽略情形,才可直接使用以 ξ ^ 为中心、标准误约为 ξ ^ / k 的通常近似。
参考资料