形式陈述
块最大值与高门槛超额看起来是两种不同数据,为什么会共享一个尾形状参数?设总体 的右端点为 ,且 ,即属于形状 的最大值吸引域公理库最大值吸引域Maximum domain of attraction · Tail quantile criterion for extreme values最大值吸引域把总体尾部与特定极值极限联系起来,尾分位的扩展正则变化同时给出判据与归一化。。对 且 ,通过正概率事件上的条件概率公理库条件概率Conditional probability在已知正概率事件发生后,把交集概率重新规范到该事件内部。定义超额分布函数
Pickands–Balkema–de Haan 定理保证存在尺度函数 ,使
其中 是广义 Pareto 分布公理库广义 Pareto 分布Generalized Pareto distribution · GPD广义 Pareto 分布用一个形状参数统一幂尾、指数尾与有限端点,并在提高超越门槛后保持形状、更新尺度。的分布函数,有限支持以外补为一。 在总体剩余支持以外也补为一。若 , 就是 。
关键在于形状仍是同一个 ,尺度则可以随门槛改变。这是分布函数的绝对误差一致趋零,不是所有极小尾概率的相对误差都趋零,也没有给出某个有限门槛已经足够高的通用数值。
直觉
最大值的极限由 控制;条件超额的尾部则是两个邻近高门槛概率的比值。只要总体尾部在合适尺度上具有稳定形状,去掉共同的稀有概率因子,就会留下同一种标准超额曲线。
块方法每块只保留最大值,阈值方法保留所有超过门槛的观测。定理说明二者的形状应当相容,但并未保证有限样本中的偏差、方差或依赖影响完全一样。
例子与边界
三个恰好没有逼近误差的基准
对 Pareto 尾 、,任意 都有
因此 、,在每个门槛上就已经精确是 GPD。
对率 的指数分布和门槛 ,无记忆性给出 。对 均匀分布,取 ,则在 上有条件尾 ,对应 。三种最大值形状在超额分布中完整保留。
正态超额并不精确指数,却渐近指数
若 ,令 。正态尾关系 给出,对固定 ,
所以可取 ,形状 。更高门槛后的绝对超额反而越来越小,乘以 后才看到稳定的指数形状。若不缩放,只看 ,它会退化趋零,不能得到非退化极限。
推论与应用
从尾分位判据走到条件尾
令 ,并取吸引域判据中的 。最大值尾概率等价式给
在允许的内部 上成立; 时,右端为一。两式相除便得到
这先处理分位门槛 。一般门槛可用相邻分位高度夹逼;吸引域条件保证高尾部的跳跃或分位间隙在归一化尺度下不会留下非消失误差。相应地选择 ,就得到任意 的结论。
点态极限为何能升级为一致分布误差
标准 GPD 的分布函数连续,包括有限端点处。先选一个足够大的有限区间,使极限分布在右端以外的尾概率很小;再把区间分成有限多个小段,使极限分布在每段增长很小。
在所有网格端点上,已经有分布函数收敛。利用原分布函数和极限分布函数都单调,每段内部的误差被两个端点误差加上极限在该段的增长控制;两端尾部则用接近零和一控制。依次缩小网格与尾概率,就得到全实轴的一致误差。把标准化坐标 换回 ,不会改变上确界。
总体稀有概率还需要一项发生率
假设在门槛 处有 ,超额模型取 。则
GPD 只给条件概率 ;若忘了乘 ,会高估一百倍。
提高门槛通常减少模型逼近偏差,却也减少可用数据。定理本身不选择门槛,更不为外推到任意远处提供相对误差保证。数据有依赖时,单个观测的边缘超额仍可有相同形状,但超越次数的分布与估计标准误必须另外处理,见极值指数与聚簇公理库极值指数与超越聚簇Extremal index极值指数比较平稳序列最大值与同边缘独立样本的极限,量化高超越聚簇对有效极端事件数的影响。。
参考资料