Skip to content

返回学习路线

极端高度、阈值选择与聚簇计数:单元验收题及解答 ​

任务:尾部模型能支持哪种结论 ​

主线先读正则变化与 Karamata,理解尺度和尾矩,再进入最大值类型、吸引域、GPD 与阈值定理。次指数分布是固定和的支线;Hill 是未知尾形状的推断入口;极值指数与 Poisson 点过程共同审计独立计数假设。

本题通过具体窗口的计数公式完成计算;最后一站用 Radon 测度与模糊收敛刻画整个点过程的证明,可作为进阶延伸阅读。

完成以下四项分析,每次注明极限是样本量增长、门槛增长还是固定项数。

  1. 已知 P(X>x)=x−2、x≥1。为 n 个独立观测选择最大值归一化,计算 n=10000 时最大值的近似 95% 分位;另从门槛 u=20 的超额模型重算单项超过 100 的概率和条件均值。再比较 min(X,50) 与 X∣X≤50 的最终极值行为。
  2. 现在只给出另一组演示数据 1,1.2,1.4,1.8,2,3,4,8。在未知正形状重尾的假设下,分别用 k=2,3,4 手算 Hill,并把尾概率外推到 p=0.001 对应的高度。解释这些数值能、不能说明什么。
  3. 另设独立创新 Yt 的分布为 P(Yt≤y)=e−y−2,令 Zt=max(Yt,Yt−1)。在 un=2n 处计算边缘超越数的均值、无超越概率及极值指数,并说明为什么原始计数不能用普通 Poisson 代替。
  4. 回到第一项的独立 Pareto 样本,保留时间与高度的点测度。计算前半段时间且高度介于 n 与 2n 的计数极限;从点过程恢复最大值及第二大值分布。如果在一个计数窗口观察到零次事件,Poisson 近似怎样给发生率的单侧界,聚簇又会怎样改变它?

解答一:同一尾形状连接最大值、超额与尾矩 ​

幂尺度与最大值 ​

尾函数 x−2 属于指数 −2 的正则变化,形状参数为 ξ=1/2。取 an=n、bn=0,则对固定 z>0 及充分大的 n,

P(Mn/an≤z)=(1−z−2n)n⟶e−z−2,z>0.

这满足极值类型定理的存在前提。按尾分位判据的标准 GEV 坐标,也可取 bn=n、an=n/2;两种归一化仅相差位置尺度。

由 e−n/q2≈0.95,得到

q0.95approx=n−log⁡0.95≈441.5396(n=10000).

精确值由 (1−q−2)n=0.95 得

q0.95exact=(1−0.951/n)−1/2≈441.5402.

这里模型已知,近似误差可直接核验;若尾指数要由数据估计,参数误差需要另外计入。

阈值与条件均值 ​

给定 X>20,超额 X−20 的尾为

P(X−20>y∣X>20)=(1+y20)−2.

它是形状 1/2、尺度十的GPD。在这个精确 Pareto 基准里,阈值定理所给的近似已经是恒等式。因此

P(X>100)=P(X>20)P(X−20>80∣X>20)=1400(1+8020)−2=10−4.

GPD 额外超额均值为 10/(1−1/2)=20,加回门槛得 E[X∣X>20]=40。Karamata 尾积分也给

E[X1{X>20}]=20⋅20−2+∫20∞t−2dt=110.

除以 P(X>20)=1/400,仍得到四十。

对于固定三项之和,一大跳原理给 P(X1+X2+X3>x)∼3x−2,x→∞。这是固定项数的和尾,不是把 n 项和随 n 增长的概率也替成同一公式。

同样叫“截断”,端点机制却不同 ​

若观测被封顶为 C=min(X,50),则在五十处有原子 P(C=50)=1/2500。n 个封顶观测的最大值等于五十的概率为

1−(1−1/2500)n⟶1.

因而不能以通常线性归一化获得本单元的非退化连续 GEV 极限。越来越多数据只会使封顶值更确定。

若取的是条件截断变量 T=X∣X≤50,没有端点原子,其尾为

P(T>x)=x−2−50−21−50−2,1≤x<50.

令 x=50−s,当 s↓0 时,

P(T>50−s)∼cs,c=2503(1−50−2).

这是有限端点附近指数一的尾,故形状为 ξ=−1。取 bn=50、an=1/(nc),对 z≤0,P((maxTi−50)/an≤z)→ez。截断以下的一段幂律图像,不能替代最终端点机制的检查。

解答二:Hill 的手算与外推敏感性 ​

按照Hill 估计量的第 k+1 大门槛约定:

  • k=2:门槛 u=3,ξ^=12log⁡(32/9)≈0.6343
  • k=3:门槛 u=2,ξ^=13log⁡12≈0.8283
  • k=4:门槛 u=1.8,ξ^≈0.7266

若用门槛超越比例 k/n 估计 P(X>u),并把条件尾近似为 (x/u)−1/ξ^,解

kn(qpu)−1/ξ^=p

得到尾分位外推

q^p=u(knp)ξ^.

这里 p 是尾概率,分布概率为 1−p。代入 n=8,p=0.001,三个结果依次约为

99.55,271.09,164.55.

最高观测只有八,外推高度却相差近三倍,清楚暴露了门槛与形状敏感性。这份演示不能认证数据真的来自正则变化尾,也不能把八个观测当作满足中间次序渐近的充分证据。

理论上需要 k→∞、k/n→0;若要用正态标准误,还需二阶尾误差在 1/k 尺度下受控。纯 Pareto 模型的无偏性不能自动延伸到任意看起来像幂尾的数据,更不能因某个 k 给出的数值顺眼就忽略另外两个结果。

解答三:边缘超越不等于独立冲击数 ​

Zt=max(Yt,Yt−1) 的边缘分布是 FZ(z)=e−2z−2。在 un=2n 处,

ENn=nP(Z0>un)=n(1−e−1/n)→1.

另一方面,max1≤t≤nZt=max(Y0,…,Yn),因此

P(Nn=0)=exp⁡(−n+12n)→e−1/2.

与同边缘独立样本的 e−1 对照,极值指数为 θ=1/2。

底层大创新数趋向 K∼Poisson(1/2)。每个孤立大创新产生两个相邻超越,两个大创新恰好相邻的概率趋零,两端边界影响也趋零,所以

Nn⇒2K.

极限均值为一,方差为二,且只取偶数。均值一的普通 Poisson 变量方差却是一,也可取奇数。只匹配边缘期望会丢掉最关键的聚簇结构。

解答四:二维点计数与可解释的不确定性 ​

矩形与次大值 ​

对独立 Pareto 样本,Poisson 点过程极限使用

Nn=∑i=1nδ(i/n,Xi/n),μ(dt,dy)=dt2y−3dy.

在 A=(0,1/2]×(1,2] 上,强度 μ(A)=3/8,故 Nn(A)⇒Poisson(3/8)。对 n=128,精确无点概率是

(1−34n)n/2≈0.686532,

Poisson 近似为 e−3/8≈0.687289。

在 [0,1]×(z,∞] 上的强度为 z−2。最高点不超过 z 当且仅当计数为零;第二大点不超过 z 当且仅当计数至多为一。因此

P(Mn/n≤z)→e−z−2,P(X(n−1)/n≤z)→e−z−2(1+z−2).

以 z=1 为例,第二大值不超过 n 的极限概率为 2/e。状态空间必须避开高度零;全部普通观测在缩放后会堆向零,不能把整幅平面的总点数套成有限均值 Poisson。

零次事件给的是频率推断,不是“风险为零” ​

若一个窗口的计数近似服从 Poisson(λ),观察到零次时,解

Pλ(N=0)=e−λ=0.05

得到单侧 95% 频率置信上界 λU=−log⁡0.05≈2.996。准确说,这是 Poisson 模型下通过检验反演得到的零计数端点;不是给定数据后“参数小于此值的概率是 95%”。在极值点过程应用中,Poisson 本身是近似,参数估计、非平稳性与模型偏差还要另外评估。

若每个冲击确定产生两次超越,原始超越计数的均值记为 λ,那么簇数均值是 λ/2,无超越概率为 e−λ/2。同样的零读数只给原始均值上界

λU=−2log⁡0.05≈5.991.

把聚簇数据误当独立点,会在这个例子中把上界压小一半。正确的计数单位与尾形状同样重要。

验收标准 ​

  • 分清最大值样本量极限、固定和门槛极限与中间次序估计极限
  • Pareto 的最大值、GPD 超额、原始尾概率和 Karamata 条件均值相互吻合
  • 明确封顶原子与条件截断连续端点会产生不同极值行为
  • Hill 门槛取第 k+1 大值,区分 ξ 与倒数 α,报告外推敏感性
  • 用底层创新的精确计数求 θ,不只凭图像宣称有聚簇
  • 时间—高度区域的强度、最高与次高值的计数事件转换正确
  • 零计数置信界说明频率含义和近似条件,且不忽略聚簇及参数不确定性