形式陈述
已经超过门槛的观测,还会多出多少?广义 Pareto 分布(GPD)是定义在非负超额 上的概率分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。。给定尺度 、形状 ,其尾函数为
若 ,取极限 。若 ,上端点为 ,到达或超过该端点后尾概率为零;若 ,上端点为无穷。负 的分布函数为零。
它最重要的结构是阈值稳定性:若 在支持内部,则以条件概率公理库条件概率Conditional probability在已知正概率事件发生后,把交集概率重新规范到该事件内部。定义的超额满足
形状保持不变,尺度按门槛线性更新,且支持条件保证新尺度为正。GPD 描述的是门槛以上的额外高度;若原观测为 ,必须把门槛 加回才能得到原始高度。
直觉
提高门槛后,留下的是更极端的一小部分数据。幂尾会使剩余的典型超额随门槛变大,有限端点则使可用的剩余空间越来越小;指数尾恰好处于剩余尺度不变的情形。
因此阈值稳定性不是一律“忘记已经走过的距离”。它允许记忆通过尺度更新保留下来。只有 才退化为真正的无记忆性。
例子与边界
提高门槛并不会把尺度留在原处
取 ,则 。把额外门槛提高到 ,新尺度应为 。直接计算
它确实是形状 、尺度四的 GPD。原均值是 ,提高门槛后的额外均值变为八,因此 。
负形状给出剩余空间
若 ,尾函数为 ,支持 ,就是区间上的均匀分布。给定 ,剩余量 在 均匀分布,新尺度 。门槛不能提高到端点五再条件化,因为该事件的概率为零。
指数分布只是零形状特例
当 ,利用 ,
于是得到均值 的指数分布公理库指数分布Exponential distribution具有恒定失效率和连续无记忆性的非负等待时间分布。。尺度更新 变成常数 ,阈值稳定性正好变成无记忆性。
推论与应用
稳定性的代数证明
先取 且 。对 且 ,条件尾概率为
右端就是所述 GPD。若 ,新上端点为 ,恰是原端点减去新门槛;支持也一起对上。
分位与矩的存在条件
令 为分布概率,解 得
这也给出逆变换模拟公式。对正形状, 时分位发散;负形状时趋向有限端点。
由Tonelli 的非负尾积分公式公理库Tonelli 定理Tonelli's theorem非负可测函数的二重积分与两种迭代积分相等,允许共同取无穷。,(有限支持外尾为零)可得
同理由 ,
在相应正形状临界值及以上,均值或二阶矩发散。负形状因有界支持,所有正阶矩都有限。前面的 例子均值有限,方差却无穷;有限样本总能算出一个有限样本方差,并不能改变总体矩的性质。
从条件超额恢复原始尾概率
若 以 GPD 建模,而 ,则对 ,
在精确模型中成立,在高门槛近似中则是近似式。条件形状不能独自决定总体超越概率,还必须乘回进入门槛以上的概率 。
Pickands–Balkema–de Haan 定理公理库Pickands–Balkema–de Haan 阈值定理Pickands-Balkema-de Haan theorem · Peaks-over-threshold limit theorem属于极值吸引域的总体,其高门槛以上的条件超额可由同形状参数的广义 Pareto 分布一致逼近。说明哪些总体的高门槛超额渐近接近这个族。阈值稳定性是族本身的精确性质,渐近逼近则是关于更广总体的另一个结论。
参考资料