形式陈述
分位数回归要估计响应在给定输入下的位置,例如“同样输入条件下,九成响应不超过哪里”。它需要完整的条件分布 理路 条件分布 Conditional distribution · Regular conditional distribution 给定观测值后随机量的概率律,以及它与原联合分布相容的核表示。 ,而不只需要条件均值。
固定 0 < τ < 1 ,选择条件CDF版本 F x ( t ) = P ( Y ≤ t ∣ X = x ) 。其 τ 分位集合为
Q τ ( x ) = { q : F x ( q − ) ≤ τ ≤ F x ( q ) } . 集合可能是一段区间。需要单值规则时,取左分位 q τ ( x ) = inf { t : F x ( t ) ≥ τ } 。条件分布在 P X -几乎处处意义下确定;讨论一个固定零概率输入的点值,还需连续等结构指定相应版本。
定义pinball损失,也称check损失:
ρ τ ( u ) = u ( τ − 1 u < 0 ) = { τ u , u ≥ 0 , ( 1 − τ ) ( − u ) , u < 0. 预测为 a 时残差 u = Y − a 。低估支付每单位 τ ,高估支付每单位 1 − τ 。在 E | Y | < ∞ 下,对实值预测函数定义总体风险 理路 损失函数与总体风险 Loss function · Population risk · Expected risk 损失刻画一次决策的代价,总体风险是未知分布下的平均代价。
R τ ( g ) = E ρ τ ( Y − g ( X ) ) . 对几乎每个 x ,使条件风险最小的 a 恰为 Q τ ( x ) 。在非空函数类 G 中,假定下式最小值取得并有预先约定的可测选解规则,经验分位数回归解
(1) g ^ ∈ arg min g ∈ G 1 n ∑ i ρ τ ( Y i − g ( X i ) ) . 若所用函数类不能保证达到最小值,应另定近似误差容限与返回规则;式(1)本身没有保证任意函数类都存在解。经验最优、类内总体最优、真实条件分位数是三个对象。类不包含真实分位函数时,式(1)不会仅因样本增加而变成无偏的逐点分位估计。
直觉
平方损失使很远的响应有很大牵引力,最优中心是条件均值 理路 回归学习与平方损失 Regression learning · Square-loss regression · 平方损失回归 以条件均值为 Bayes 预测器组织平方损失回归,并说明无界响应、噪声尾部与函数类复杂度如何共同决定风险保证。 。绝对损失只在意残差方向及线性距离,最优中心是条件中位数;pinball再把两个方向的单位代价调得不一样,就能瞄准其他分位。
分位数的水平 τ 是目标,不是从拟合好坏得出的置信度。0.9分位函数是一条描述条件分布的位置曲线;它本身没有声称这条估计曲线以90%概率等于真曲线,也没有自动提供未来响应的90%覆盖集合。
例子与边界
两组数据,均值、中位数和上分位给不同回归线
有六个训练对:X = 0 对应响应 ( 0 , 1 , 9 ) ,X = 1 对应 ( 2 , 3 , 11 ) 。采用函数类 g ( x ) = a + b x 。因为只有两个输入值,a 和 a + b 可以分别取任意实数,目标分解为两组各自的标量损失。
平方损失得到两组均值 10 / 3 , 16 / 3 ,故 g m e a n ( x ) = 10 / 3 + 2 x 。τ = 1 / 2 的pinball损失是绝对损失的一半,两组中位数为1、3,得到 g 0.5 ( x ) = 1 + 2 x 。τ = 3 / 4 时,每组三个等权点的左分位是最大值9、11,得到 g 0.75 ( x ) = 9 + 2 x 。
可直接检查第一组:预测1的pinball总损失为
1 4 ⋅ 1 + 0 + 3 4 ⋅ 8 = 25 / 4 ; 预测9的总损失为 1 4 ( 9 + 8 ) = 17 / 4 。上分位更愿意付出若干较小高估,来避免对大响应低估8个单位。这份数据中恰有相同斜率2;一般不同分位可以有不同斜率。
若各输入条件下的三个响应值也各以概率 1 / 3 出现,上述三条曲线同时就是对应总体目标。若限制 b = 0 ,只能在全部六个响应间选一个常数,例如 τ = 3 / 4 的左分位是9,无法同时给 X = 1 的真实上分位11。函数类限制产生的是逼近问题。
局部加权分位数可以手算,但不能用负平均权重
固定查询 x ,用非负核值给响应 ( 0 , 2 , 10 ) 分配归一化权重 ( 1 / 2 , 1 / 4 , 1 / 4 ) 。局部常数分位估计最小化
(2) ∑ i w i ( x ) ρ τ ( Y i − a ) . 在 τ = 3 / 4 时,累计权重到响应2恰为 3 / 4 。全部 a ∈ [ 2 , 10 ] 都最优;左分位约定返回2。把 τ 改为0.8,左分位便为10。这种跳变与并列最优是目标的真实性质,不能默默用线性插值替换后仍称同一经验损失最小解。
局部线性均值 理路 局部多项式回归 Local polynomial regression · Local linear regression · 局部线性回归 在每个查询邻域解加权多项式拟合,用矩复制解释边界去偏,并核算负权重、局部秩与噪声代价。 的等价响应权重可能为负。把这些负权重直接代入式(2),不再有加权CDF,也可能失去凸性。若需要局部分位直线,应在原始非负核权重下最小化 ∑ i a i ρ τ ( Y i − β 0 − β 1 ( X i − x ) ) ,求解新的凸问题;不能先算均值权重再套加权分位。
同一个均值,不同的条件区间宽度
令 X ∈ { 0 , 1 } ,Y = 2 X + s ( X ) U ,其中 U ∼ U [ − 1 , 1 ] 独立于 X ,s ( 0 ) = 1 , s ( 1 ) = 3 。均值为 m ( x ) = 2 x ,条件分位则是
q τ ( x ) = 2 x + s ( x ) ( 2 τ − 1 ) . 真实的10%至90%区间在 X = 0 为 [ − 0.8 , 0.8 ] ,在 X = 1 为 [ − 0.4 , 4.4 ] ,各有80%条件覆盖。若把第一组的半宽0.8搬到第二组、围绕均值2输出 [ 1.2 , 2.8 ] ,第二组覆盖仅为 1.6 / 6 = 4 / 15 。均值预测完全正确也不能决定响应分布的宽度。
推论与应用
为何最小化 pinball 会得到分位数
固定一个具有有限一阶矩的条件分布,记 G ( a ) = E ρ τ ( Y − a ) 。作为 a 的函数,单条损失在 a < Y 时斜率 − τ ,在 a > Y 时斜率 1 − τ ;拐点处左右导数不同。各斜率绝对值不超过1,因此可把单侧差商用有界支配交换进期望,得到
G − ′ ( a ) = F ( a − ) − τ , G + ′ ( a ) = F ( a ) − τ . G 凸,最小点条件是左导数不大于0、右导数不小于0,恰为 F ( a − ) ≤ τ ≤ F ( a ) 。这也解释了有原子或CDF平台时为什么最优点可以不唯一。
更定量地,对任一最优分位 q ,
(3) G ( a ) − G ( q ) = ∫ q a [ F ( t ) − τ ] d t . 这是把有界斜率沿区间积分;CDF在至多可数个跳点的具体单点值不影响积分。若 F 在 q 处连续、F ( q ) = τ ,且 q 至 a 之间的密度有下界 f ( t ) ≥ c > 0 ,则
(4) G ( a ) − G ( q ) ≥ c 2 ( a − q ) 2 . a > q 时由 F ( t ) − F ( q ) ≥ c ( t − q ) 积分;a < q 时反向同理。低密度区的小pinball超额风险未必给同样小的数值误差;式(4)明确展示了还需要哪一种局部识别条件。对每个输入应用后再积分,还需相应的条件密度下界与预测范围,不能只看无条件响应密度。
从分组到一般线性拟合
给设计矩阵 A 、响应向量 y ,线性分位回归可写成线性规划
(5) min β , r + , r − τ 1 ⊤ r + + ( 1 − τ ) 1 ⊤ r − , A β + r + − r − = y , r + , r − ≥ 0. 两种残差非负部分分别承担低估与高估成本。返回参数、目标值和求解容差;参数或预测可能不唯一,不应在无唯一性条件时报告“唯一分位直线”。优化器的残差与目标证书只核验式(5),不证明统计覆盖。
局部常数版本有更简单的直接算法:先删去零权重记录;检查总权重为正;按响应排序并累积权重;返回第一个累计比例达到 τ 的响应。排序需 O ( n log n ) 时间、O ( n ) 存储;排序结束并越过目标累计水平即停止。重复查询可复用响应排序,但各查询权重仍需计算;空邻域必须使用预先规定的失败或后备规则。
分位函数与校准后的预测集合
若有真实的两个条件分位 q α / 2 ( x ) 与 q 1 − α / 2 ( x ) ,区间两侧漏失概率分别至多 α / 2 ,所以至少有 1 − α 条件覆盖;连续且严格穿越这些分位时取得等号。用估计分位直接替换,不再拥有同一个已知概率计算。
可以在独立训练集拟合并冻结两条分位曲线,再用分割共形 理路 分割共形预测 Split conformal prediction · 分割保形预测 用冻结评分规则的校准秩构造预测集合,并在预先固定群组内分别校准,以获得边际或群组覆盖保证。 对越界分数校准,获得相应可交换条件下的边际覆盖。分位模型改善宽度形状,校准秩承担覆盖证明。若两条拟合曲线交叉,应预定修复规则并在校准前完成,不能看校准残差后任意改曲线。
样本分位渐近理论 理路 样本分位数的渐近线性化 Sample quantile asymptotics · Bahadur representation for a sample quantile 在目标分位附近密度连续且为正时,经验分位的随机逆可线性化,余项由局部经验分布振荡控制。 与固定秩分位置信区间 理路 分布无关的分位数置信区间 Distribution-free quantile confidence interval · Exact order-statistic confidence interval 用固定秩的样本次序值夹住总体分位数,覆盖概率精确化为二项计数,无需估计密度或指定分布形状。 处理一份总体分位的估计和推断;本页进一步把目标按输入条件化并限制函数类。局部复杂度 理路 局部 Rademacher 复杂度 Local Rademacher complexity · 局部化复杂度 围绕低风险或低方差函数逐层收缩函数类,以复杂度不动点刻画快于全局平方根速率的超额风险。 讨论的是低风险函数集合,不是本页在输入空间挑近邻,两种“局部”承担不同工作。
自测与答案
两组例中在第一组预测0、τ = 3 / 4 ,总损失是多少?3 4 ( 1 + 9 ) = 15 / 2 ,高于预测9时的 17 / 4 。
权重 ( 1 / 2 , 1 / 4 , 1 / 4 ) 的三个响应若都乘2,加权0.75左分位如何变?从2变为4,全部最优区间从 [ 2 , 10 ] 变为 [ 4 , 20 ] 。固定正比例变换保留累计权重和秩。
参考资料