Skip to content

方法Method

核密度估计的边界修正

Kernel density boundary correction · Reflection kernel density estimator

在已知支持上反射核质量,证明归一化、计算边界偏差,并区分半直线、有限区间与非零边界斜率。

形式陈述 ​

普通核密度估计在边界会把质量放到支持以外。本页以已知支持 [0,∞) 为起点。设 X1,…,Xn 为非负IID观测。讨论密度估计目标时,假定其共同分布关于Lebesgue测度具有密度 f,并在所讨论的边界有右侧连续版本;算法的归一化本身则不要求真实密度存在。取核 K≥0、K(u)=K(−u)、∫RK=1,带宽 h>0。反射估计定义为

(1)f^hR(x)=1nh∑i=1n[K(x−Xih)+K(x+Xih)],x≥0,

x<0 时置零。每个原始点 Xi 在零的另一侧放一个镜像 −Xi,但分母仍是 nh,不是 2nh。

估计非负,而且对每份样本都有

(2)∫0∞f^hR(x)dx=1.

因此它确实是一份定义在半直线上的概率密度。边界目标取一个右侧连续版本的极限 f(0+);任意改写密度在单点0的数值不会改变分布,本页不把无法由分布识别的任意单点赋值当成估计目标。

式(1)要求支持下界已知。如果样本中出现负数,应先检查支持假设或数据含义,不能静默取绝对值。若真实支持还存在有限上界,则必须处理另一端,见下文。

直觉

靠近零的一个核有一部分伸到负半轴。反射不是简单把这部分剪掉,而是把镜像核伸回来的相应部分加在正半轴上。每个原始观测贡献的总质量因此仍恰为 1/n。

反射还把曲线在零附近延拓成偶函数。偶延拓适合边界处斜率为零的曲线;若真密度在边界正以非零斜率变化,反射会强行抹平这个趋势。恢复总质量与恢复更高阶局部形状是两件需要分别核对的事。

例子与边界

一个观测的质量,逐段积分 ​

取 n=1、X1=0.1、h=0.2,矩形核 K(u)=121|u|≤1。普通KDE在 [−0.1,0.3] 上高度为2.5;直接删除负半轴后只剩质量 2.5×0.3=0.75。

镜像点 −0.1 的核在 [0,0.1] 再贡献高度2.5。因此忽略有限个端点值,反射估计为

f^hR(x)={5,0≤x<0.1,2.5,0.1<x≤0.3,0,x>0.3.

总质量为 5×0.1+2.5×0.2=1。若镜像加入后仍按两条“独立样本”除以 2h,限制到正半轴只剩质量 1/2。

同一修正,对均匀密度和指数密度给不同偏差阶 ​

先取 X∼U[0,1],仍用矩形核。对 0<h≤1,普通KDE在零处的期望是 1/2;反射估计在零处逐样本恰为普通估计的两倍,故期望为1,等于 f(0+)。

再取半直线上的指数密度 f(t)=e−t,f(0+)=1、f′(0+)=−1。此时

(3)Ef^hR(0)=1h∫0he−tdt=1−e−hh=1−h2+h26+O(h3).

反射去掉了普通KDE的常数级缺口,但仍留下 −h/2 的一阶偏差。h=0.2 时期望约为0.90635,实际偏差约 −0.09365。这个差别来自真密度的边界斜率,而不是核是否归一化。

两侧都有边界时 ​

若真实支持为 [0,1],只反射零不会保证估计在该区间积分为1。一个观测 X1=0.9、矩形核 h=0.2,在零反射后仍有核质量泄到1以外;[0,1] 内质量只有0.75。

若 K 支撑 [−1,1] 且 0<h≤1,可对每个点同时加入 −Xi 和 2−Xi,在 [0,1] 内定义

(4)f^h[0,1](x)=1nh∑i[K(x−Xih)+K(x+Xih)+K(x−(2−Xi)h)],

区间外为零。有限支撑与 h≤1 保证左镜像只补左漏失、右镜像只补右漏失,各原始观测总质量恢复为 1/n。Gaussian核有无限尾部,或带宽超过区间长度时,只有这三项一般不再精确归一化;可研究无限镜像、另作归一化或采用其他边界方法,但要重新核对其偏差。

推论与应用

归一化的证明 ​

对一个原始观测 a≥0,变量代换给两项积分

∫0∞1hK((x−a)/h)dx=∫−a/h∞K(u)du,∫0∞1hK((x+a)/h)dx=∫a/h∞K(u)du.

对称性使第二项等于 ∫−∞−a/hK(u)du,两项之和恰为1。对 n 个原始点平均得到式(2)。镜像没有增加独立抽样数;证明只是在分配同一条记录的质量。

对式(4),原核在 [0,1] 漏掉的左尾为 ∫−∞−a/hK、右尾为 ∫(1−a)/h∞K。左镜像在区间内的积分恰为前者,右镜像恰为后者:其远端积分端点由于 h≤1 已超出 [−1,1]。三项合起来仍为1。这说明两端修正依赖的并非只有“再复制两个点”。

边界偏差与斜率条件 ​

再假定 K 对称、支撑 [−1,1],f在零右侧有二阶连续导数。对式(1)取期望,核对称给

Ef^hR(0)=2∫01K(u)f(hu)du.

令 μ1+=∫01uK(u)du、μ2=∫−11u2K(u)du。对 f(hu) 用右侧Taylor展开,得到

(5)Ef^hR(0)−f(0+)=2hμ1+f′(0+)+h2μ22f″(0+)+o(h2).

只有 f′(0+)=0(或其他消去首项的特殊情形)时,才恢复这里的二阶偏差。若核可微,其导数为奇函数,式(1)两项在零处的导数逐样本相消,f^hR′(0+)=0;这进一步揭示了方法施加的边界形状。

方差和变换的责任 ​

在零处 f^hR(0)=2f^h(0),故反射估计的方差是原边界估计方差的四倍。不能把镜像看成 2n 条独立资料而声称方差减半;两项由同一个 Xi 生成。

对 X>0,另一条路线是先对 Z=log⁡X 估计密度 g,再用 f(x)=g(log⁡x)/x 返回。Jacobian因子 1/x 负责质量变换,也可能放大零附近的误差;有真实零原子时,这个连续密度变换不能覆盖整个分布。

本页修正的是密度质量与边界形状。NW回归已在每个查询处对记录重新归一化,其边界问题主要是单侧趋势;局部直线通过矩复制处理趋势,不能把本页的密度镜像默认移给回归响应。

实现时无需实际存储镜像数据:每个查询对每条原始记录计算两次核,半直线版为 O(n) 核求值、O(1)累计空间;全曲线在 G 个网格点直接求值为 O(nG)。有限区间版每点三次核求值。支持、带宽、核和边界规则必须一起报告。

自测与答案 ​

  1. 把 f(0) 任意改成7,其他密度值不变,样本分布或式(3)会变吗?不会;连续右极限仍为1,本页目标是这个右极限。
  2. 指数密度例将带宽从 h 减为 h/2,首阶偏差如何改变?约减半,而不是减为四分之一;非零右导数使首项为一阶。
参考资料
  • B. W. Silverman, Density Estimation for Statistics and Data Analysis, 1986,§2.10 “Bounded domains and directional data”;此大学镜像为前两章的HTML打印版,PDF pp. 20–21,反射归一化、边界导数和有限区间讨论。本文式(2)–(5)及指数密度例为逐项积分推导。
关系图谱8 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具