返回学习路线
极端高度、阈值选择与聚簇计数:单元验收题及解答
任务:尾部模型能支持哪种结论
主线先读正则变化与 Karamata,理解尺度和尾矩,再进入最大值类型、吸引域、GPD 与阈值定理。次指数分布是固定和的支线;Hill 是未知尾形状的推断入口;极值指数与 Poisson 点过程共同审计独立计数假设。
本题通过具体窗口的计数公式完成计算;最后一站用 Radon 测度与模糊收敛刻画整个点过程的证明,可作为进阶延伸阅读。
完成以下四项分析,每次注明极限是样本量增长、门槛增长还是固定项数。
已知 P ( X > x ) = x − 2 、x ≥ 1 。为 n 个独立观测选择最大值归一化,计算 n = 10000 时最大值的近似 95 % 分位;另从门槛 u = 20 的超额模型重算单项超过 100 的概率和条件均值。再比较 min ( X , 50 ) 与 X ∣ X ≤ 50 的最终极值行为。
现在只给出另一组演示数据 1 , 1.2 , 1.4 , 1.8 , 2 , 3 , 4 , 8 。在未知正形状重尾的假设下,分别用 k = 2 , 3 , 4 手算 Hill,并把尾概率外推到 p = 0.001 对应的高度。解释这些数值能、不能说明什么。
另设独立创新 Y t 的分布为 P ( Y t ≤ y ) = e − y − 2 ,令 Z t = max ( Y t , Y t − 1 ) 。在 u n = 2 n 处计算边缘超越数的均值、无超越概率及极值指数,并说明为什么原始计数不能用普通 Poisson 代替。
回到第一项的独立 Pareto 样本,保留时间与高度的点测度。计算前半段时间且高度介于 n 与 2 n 的计数极限;从点过程恢复最大值及第二大值分布。如果在一个计数窗口观察到零次事件,Poisson 近似怎样给发生率的单侧界,聚簇又会怎样改变它?
解答一:同一尾形状连接最大值、超额与尾矩
幂尺度与最大值
尾函数 x − 2 属于指数 − 2 的正则变化 公理库 正则变化函数 Regularly varying function · Regular variation 正则变化以缩放比值的幂函数极限刻画幂律,允许不改变幂指数的慢变化修正。 ,形状参数为 ξ = 1 / 2 。取 a n = n 、b n = 0 ,则对固定 z > 0 及充分大的 n ,
P ( M n / a n ≤ z ) = ( 1 − z − 2 n ) n ⟶ e − z − 2 , z > 0. 这满足极值类型定理 公理库 Fisher–Tippett–Gnedenko 极值定理 Fisher-Tippett-Gnedenko theorem · Extreme types theorem 独立同分布最大值若存在线性归一化后的非退化极限,该极限必属于广义极值分布族。 的存在前提。按尾分位判据 公理库 最大值吸引域 Maximum domain of attraction · Tail quantile criterion for extreme values 最大值吸引域把总体尾部与特定极值极限联系起来,尾分位的扩展正则变化同时给出判据与归一化。 的标准 GEV 坐标,也可取 b n = n 、a n = n / 2 ;两种归一化仅相差位置尺度。
由 e − n / q 2 ≈ 0.95 ,得到
q 0.95 approx = n − log 0.95 ≈ 441.5396 ( n = 10000 ) . 精确值由 ( 1 − q − 2 ) n = 0.95 得
q 0.95 exact = ( 1 − 0.95 1 / n ) − 1 / 2 ≈ 441.5402 . 这里模型已知,近似误差可直接核验;若尾指数要由数据估计,参数误差需要另外计入。
阈值与条件均值
给定 X > 20 ,超额 X − 20 的尾为
P ( X − 20 > y ∣ X > 20 ) = ( 1 + y 20 ) − 2 . 它是形状 1 / 2 、尺度十的GPD 公理库 广义 Pareto 分布 Generalized Pareto distribution · GPD 广义 Pareto 分布用一个形状参数统一幂尾、指数尾与有限端点,并在提高超越门槛后保持形状、更新尺度。 。在这个精确 Pareto 基准里,阈值定理 公理库 Pickands–Balkema–de Haan 阈值定理 Pickands-Balkema-de Haan theorem · Peaks-over-threshold limit theorem 属于极值吸引域的总体,其高门槛以上的条件超额可由同形状参数的广义 Pareto 分布一致逼近。 所给的近似已经是恒等式。因此
P ( X > 100 ) = P ( X > 20 ) P ( X − 20 > 80 ∣ X > 20 ) = 1 400 ( 1 + 80 20 ) − 2 = 10 − 4 . GPD 额外超额均值为 10 / ( 1 − 1 / 2 ) = 20 ,加回门槛得 E [ X ∣ X > 20 ] = 40 。Karamata 尾积分 公理库 Karamata 积分定理 Karamata theorem · Karamata integral theorem 非临界指数下,正则变化函数的积分主项等于端点函数值乘长度,再除以由幂指数决定的常数。 也给
E [ X 1 { X > 20 } ] = 20 ⋅ 20 − 2 + ∫ 20 ∞ t − 2 d t = 1 10 . 除以 P ( X > 20 ) = 1 / 400 ,仍得到四十。
对于固定三项之和,一大跳原理 公理库 次指数分布 Subexponential distribution · Principle of a single big jump 次指数重尾的固定有限和超过高门槛时,主要由一个分量单独超过门槛造成,其和尾渐近为单项尾的项数倍。 给 P ( X 1 + X 2 + X 3 > x ) ∼ 3 x − 2 ,x → ∞ 。这是固定项数的和尾,不是把 n 项和随 n 增长的概率也替成同一公式。
同样叫“截断”,端点机制却不同
若观测被封顶为 C = min ( X , 50 ) ,则在五十处有原子 P ( C = 50 ) = 1 / 2500 。n 个封顶观测的最大值等于五十的概率为
1 − ( 1 − 1 / 2500 ) n ⟶ 1. 因而不能以通常线性归一化获得本单元的非退化连续 GEV 极限。越来越多数据只会使封顶值更确定。
若取的是条件截断变量 T = X ∣ X ≤ 50 ,没有端点原子,其尾为
P ( T > x ) = x − 2 − 50 − 2 1 − 50 − 2 , 1 ≤ x < 50. 令 x = 50 − s ,当 s ↓ 0 时,
P ( T > 50 − s ) ∼ c s , c = 2 50 3 ( 1 − 50 − 2 ) . 这是有限端点附近指数一的尾,故形状为 ξ = − 1 。取 b n = 50 、a n = 1 / ( n c ) ,对 z ≤ 0 ,P ( ( max T i − 50 ) / a n ≤ z ) → e z 。截断以下的一段幂律图像,不能替代最终端点机制的检查。
解答二:Hill 的手算与外推敏感性
按照Hill 估计量 公理库 Hill 尾指数估计量 Hill estimator · Hill tail-index estimator Hill 估计量平均最大的若干观测相对于随机门槛的对数比,估计正则变化重尾的形状,并显式面对门槛偏差。 的第 k + 1 大门槛约定:
k = 2 :门槛 u = 3 ,ξ ^ = 1 2 log ( 32 / 9 ) ≈ 0.6343
k = 3 :门槛 u = 2 ,ξ ^ = 1 3 log 12 ≈ 0.8283
k = 4 :门槛 u = 1.8 ,ξ ^ ≈ 0.7266
若用门槛超越比例 k / n 估计 P ( X > u ) ,并把条件尾近似为 ( x / u ) − 1 / ξ ^ ,解
k n ( q p u ) − 1 / ξ ^ = p 得到尾分位外推
q ^ p = u ( k n p ) ξ ^ . 这里 p 是尾概率,分布概率为 1 − p 。代入 n = 8 , p = 0.001 ,三个结果依次约为
99.55 , 271.09 , 164.55 . 最高观测只有八,外推高度却相差近三倍,清楚暴露了门槛与形状敏感性。这份演示不能认证数据真的来自正则变化尾,也不能把八个观测当作满足中间次序渐近的充分证据。
理论上需要 k → ∞ 、k / n → 0 ;若要用正态标准误,还需二阶尾误差在 1 / k 尺度下受控。纯 Pareto 模型的无偏性不能自动延伸到任意看起来像幂尾的数据,更不能因某个 k 给出的数值顺眼就忽略另外两个结果。
解答三:边缘超越不等于独立冲击数
Z t = max ( Y t , Y t − 1 ) 的边缘分布是 F Z ( z ) = e − 2 z − 2 。在 u n = 2 n 处,
E N n = n P ( Z 0 > u n ) = n ( 1 − e − 1 / n ) → 1. 另一方面,max 1 ≤ t ≤ n Z t = max ( Y 0 , … , Y n ) ,因此
P ( N n = 0 ) = exp ( − n + 1 2 n ) → e − 1 / 2 . 与同边缘独立样本的 e − 1 对照,极值指数 公理库 极值指数与超越聚簇 Extremal index 极值指数比较平稳序列最大值与同边缘独立样本的极限,量化高超越聚簇对有效极端事件数的影响。 为 θ = 1 / 2 。
底层大创新数趋向 K ∼ Poisson ( 1 / 2 ) 。每个孤立大创新产生两个相邻超越,两个大创新恰好相邻的概率趋零,两端边界影响也趋零,所以
N n ⇒ 2 K . 极限均值为一,方差为二,且只取偶数。均值一的普通 Poisson 变量方差却是一,也可取奇数。只匹配边缘期望会丢掉最关键的聚簇结构。
解答四:二维点计数与可解释的不确定性
矩形与次大值
对独立 Pareto 样本,Poisson 点过程极限 公理库 极端超越的 Poisson 点过程极限 Poisson point-process limit for extremes · Extreme exceedance point process 正则变化独立样本的极端观测保留发生时间与归一化高度后,形成具有幂型高度强度的 Poisson 点过程极限。 使用
N n = ∑ i = 1 n δ ( i / n , X i / n ) , μ ( d t , d y ) = d t 2 y − 3 d y . 在 A = ( 0 , 1 / 2 ] × ( 1 , 2 ] 上,强度 μ ( A ) = 3 / 8 ,故 N n ( A ) ⇒ Poisson ( 3 / 8 ) 。对 n = 128 ,精确无点概率是
( 1 − 3 4 n ) n / 2 ≈ 0.686532 , Poisson 近似为 e − 3 / 8 ≈ 0.687289 。
在 [ 0 , 1 ] × ( z , ∞ ] 上的强度为 z − 2 。最高点不超过 z 当且仅当计数为零;第二大点不超过 z 当且仅当计数至多为一。因此
P ( M n / n ≤ z ) → e − z − 2 , P ( X ( n − 1 ) / n ≤ z ) → e − z − 2 ( 1 + z − 2 ) . 以 z = 1 为例,第二大值不超过 n 的极限概率为 2 / e 。状态空间必须避开高度零;全部普通观测在缩放后会堆向零,不能把整幅平面的总点数套成有限均值 Poisson。
零次事件给的是频率推断,不是“风险为零”
若一个窗口的计数近似服从 Poisson ( λ ) ,观察到零次时,解
P λ ( N = 0 ) = e − λ = 0.05 得到单侧 95 % 频率置信上界 λ U = − log 0.05 ≈ 2.996 。准确说,这是 Poisson 模型下通过检验反演得到的零计数端点;不是给定数据后“参数小于此值的概率是 95 % ”。在极值点过程应用中,Poisson 本身是近似,参数估计、非平稳性与模型偏差还要另外评估。
若每个冲击确定产生两次超越,原始超越计数的均值记为 λ ,那么簇数均值是 λ / 2 ,无超越概率为 e − λ / 2 。同样的零读数只给原始均值上界
λ U = − 2 log 0.05 ≈ 5.991 . 把聚簇数据误当独立点,会在这个例子中把上界压小一半。正确的计数单位与尾形状同样重要。
验收标准
分清最大值样本量极限、固定和门槛极限与中间次序估计极限
Pareto 的最大值、GPD 超额、原始尾概率和 Karamata 条件均值相互吻合
明确封顶原子与条件截断连续端点会产生不同极值行为
Hill 门槛取第 k + 1 大值,区分 ξ 与倒数 α ,报告外推敏感性
用底层创新的精确计数求 θ ,不只凭图像宣称有聚簇
时间—高度区域的强度、最高与次高值的计数事件转换正确
零计数置信界说明频率含义和近似条件,且不忽略聚簇及参数不确定性