“共同支配密度使似然函数能够固定样本、比较参数,并让统计模型统一覆盖离散与连续推断。反方向上,核密度估计从样本近似未知密度;它输出的是随机估计函数,带宽偏差和抽样波动不能与真实分布密度混同。”
核密度估计 ​
给定 iid 样本与积分为一的核
若
偏差与方差 ​
若
带宽小降低平滑偏差却增加方差。积分 MSE 的典型最优阶为
推导与带宽计算 ​
期望是卷积
对
积分均方误差近似
最小化得到
未知
例子与选择 ​
Gaussian 核给处处平滑估计。交叉验证、plug-in 与规则带宽选择优化不同准则;应报告选择方法。多维中方差为
例如样本在
边界 ​
有限区间边界处对称核把质量泄到支持外,产生一阶边界偏差;可反射、变换或用边界核。带宽由看图手调后再做不确定性推断,会忽略选择。
逐点置信带与同时置信带不同。对每个固定
高维中
密度尖点、离散原子或混合测度不满足普通 Lebesgue 密度假设。KDE 会把原子强行涂抹,不能恢复不存在的光滑密度。
小带宽产生许多伪峰,大带宽抹去真实多峰;峰数不是无偏稳定统计量。
核的选择通常只影响常数,带宽决定主要平滑尺度。Gaussian、Epanechnikov 等二阶核在相同带宽下形状略异;花大量精力挑核却不审计带宽和边界,往往优化错重点。
自适应带宽在稀疏区域扩大、密集区域缩小,可改善异质平滑,但估计不再是简单固定卷积,bias、normalization 与置信带需重新推导。k-nearest-neighbor density estimator 属于这种局部尺度思路。
多变量 bandwidth 可为矩阵
对角带宽忽略坐标相关方向,全矩阵带宽更灵活却难估。先标准化坐标会改变几何,必须记录变换。
如果目标是 density derivative、mode 或 level set,最优带宽与估密度本身不同。用为 integrated density error 选择的带宽直接推断峰数,可能系统性过平滑。
cross-validation objective 也有随机局部极小点,应报告搜索区间与稳定性。把可视上“最好看”的带宽作为最终推断,属于数据重复使用。
若核有无界支持,估计在真实有界支持外仍为正;这不违反其积分为一,却可能违背科学约束。log/Probit transformation KDE 先把支持映到实线,再乘 Jacobian 返回原坐标,边界行为取决于变换。
离散变量不能直接使用 Euclidean Gaussian 核。categorical kernel、频率估计或混合数据 product kernel 各有不同 smoothing parameter;把类别编码成整数会引入虚假的距离顺序。
density ratio、classification posterior 等下游目标有时可直接估计,避免分别估两个高维密度再相除。KDE 是通用对象层,不保证对每个下游功能最有效。
置信带需要处理 bias 与随机上确界。undersmoothing 让 bias 小于 stochastic error,bias correction 则显式估
报告 KDE 应给 kernel、bandwidth 数值与选择法、边界处理、坐标变换和网格分辨率。绘图库默认值不足以构成可复核统计方法。
参考资料
- Bernard Silverman, Density Estimation for Statistics and Data Analysis, Chapman & Hall, 1986。
- M. P. Wand and M. C. Jones, Kernel Smoothing, Chapman & Hall, 1995。
- Alexandre Tsybakov, Introduction to Nonparametric Estimation, Springer, 2009。