Skip to content

模型Model

广义 Pareto 分布

Generalized Pareto distribution · GPD

广义 Pareto 分布用一个形状参数统一幂尾、指数尾与有限端点,并在提高超越门槛后保持形状、更新尺度。

形式陈述 ​

已经超过门槛的观测,还会多出多少?广义 Pareto 分布(GPD)是定义在非负超额 Y 上的概率分布。给定尺度 β>0、形状 ξ∈R,其尾函数为

P(Y>y)=(1+ξyβ)−1/ξ,y≥0,1+ξy/β>0.

若 ξ=0,取极限 P(Y>y)=e−y/β。若 ξ<0,上端点为 −β/ξ,到达或超过该端点后尾概率为零;若 ξ≥0,上端点为无穷。负 y 的分布函数为零。

它最重要的结构是阈值稳定性:若 v 在支持内部,则以条件概率定义的超额满足

Y−v∣Y>v∼GPD(ξ,β+ξv).

形状保持不变,尺度按门槛线性更新,且支持条件保证新尺度为正。GPD 描述的是门槛以上的额外高度;若原观测为 X=u+Y,必须把门槛 u 加回才能得到原始高度。

直觉

提高门槛后,留下的是更极端的一小部分数据。幂尾会使剩余的典型超额随门槛变大,有限端点则使可用的剩余空间越来越小;指数尾恰好处于剩余尺度不变的情形。

因此阈值稳定性不是一律“忘记已经走过的距离”。它允许记忆通过尺度更新保留下来。只有 ξ=0 才退化为真正的无记忆性。

例子与边界

提高门槛并不会把尺度留在原处 ​

取 ξ=1/2,β=2,则 P(Y>y)=(1+y/4)−2。把额外门槛提高到 v=4,新尺度应为 2+(1/2)4=4。直接计算

P(Y−4>z∣Y>4)=(1+(4+z)/4)−2(1+4/4)−2=(1+z/8)−2.

它确实是形状 1/2、尺度四的 GPD。原均值是 β/(1−ξ)=4,提高门槛后的额外均值变为八,因此 E[Y∣Y>4]=12。

负形状给出剩余空间 ​

若 ξ=−1,β=5,尾函数为 1−y/5,支持 0≤y≤5,就是区间上的均匀分布。给定 Y>3,剩余量 Y−3 在 (0,2) 均匀分布,新尺度 5−3=2。门槛不能提高到端点五再条件化,因为该事件的概率为零。

指数分布只是零形状特例 ​

当 ξ→0,利用 log⁡(1+z)∼z,

(1+ξy/β)−1/ξ→e−y/β.

于是得到均值 β 的指数分布。尺度更新 β+ξv 变成常数 β,阈值稳定性正好变成无记忆性。

推论与应用

稳定性的代数证明 ​

先取 v≥0 且 1+ξv/β>0。对 z≥0 且 1+ξ(v+z)/β>0,条件尾概率为

P(Y>v+z)P(Y>v)=[1+ξ(v+z)/β1+ξv/β]−1/ξ=(1+ξzβ+ξv)−1/ξ.

右端就是所述 GPD。若 ξ<0,新上端点为 −(β+ξv)/ξ=−β/ξ−v,恰是原端点减去新门槛;支持也一起对上。

分位与矩的存在条件 ​

令 p∈(0,1) 为分布概率,解 P(Y>qp)=1−p 得

qp={βξ[(1−p)−ξ−1],ξ≠0,−βlog⁡(1−p),ξ=0.

这也给出逆变换模拟公式。对正形状,p↑1 时分位发散;负形状时趋向有限端点。

由Tonelli 的非负尾积分公式,EY=∫0∞P(Y>y)dy(有限支持外尾为零)可得

EY=β1−ξ(ξ<1).

同理由 EY2=2∫0∞yP(Y>y)dy,

Var(Y)=β2(1−ξ)2(1−2ξ)(ξ<1/2).

在相应正形状临界值及以上,均值或二阶矩发散。负形状因有界支持,所有正阶矩都有限。前面的 ξ=1/2 例子均值有限,方差却无穷;有限样本总能算出一个有限样本方差,并不能改变总体矩的性质。

从条件超额恢复原始尾概率 ​

若 X−u∣X>u 以 GPD 建模,而 pu=P(X>u),则对 x>u,

P(X>x)=pu(1+ξx−uβu)−1/ξ

在精确模型中成立,在高门槛近似中则是近似式。条件形状不能独自决定总体超越概率,还必须乘回进入门槛以上的概率 pu。

Pickands–Balkema–de Haan 定理说明哪些总体的高门槛超额渐近接近这个族。阈值稳定性是族本身的精确性质,渐近逼近则是关于更广总体的另一个结论。

参考资料
关系图谱8 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系

使用的工具