“约束极值把梯度投影到允许方向,在线梯度下降则在每轮损失揭示后走负梯度或次梯度步,并用到比较器的距离控制 regret。梯度 boosting是在函数空间中沿经验损失的负梯度方向逐步加入基学习…”
加法模型 ​
Gradient Boosting 构造逐阶段加法预测器
其中
与在有限维参数上直接求梯度不同,待优化对象是函数
负梯度伪残差 ​
第
这些
再通过一维线搜索选择
最后更新
基学习器未必能精确表示负梯度。最小二乘拟合相当于在样本内积下,把梯度方向投影到
平方损失为何给出普通残差 ​
对
有
因此伪残差就是熟悉的
对二分类 logistic 损失,伪残差与当前预测概率和标签之差相关,困难或错分样本获得较大修正。它与 AdaBoost 的指数重加权有相似函数梯度图像,却不是同一更新式。
树作为基学习器 ​
当
再更新
树深控制单轮可表达的交互阶数:树桩只作一次切分,深树能拟合高阶交互,却也更容易追逐样本噪声。
一个具体过程 ​
在房价回归中,初始常数
若某条记录的价格录入错误,平方损失伪残差会极大,许多后续树可能反复围绕它切分。换用稳健损失、限制叶子最小样本数或提前停止,是在目标与函数类层面处理问题;仅把树数增多会让训练风险更低,却不会修复污染。
正则化与停止 ​
shrinkage
训练经验损失沿轮次下降只说明优化进展。总体风险还受样本误差、基类复杂度和超参数选择影响。若损失无下界、步长不受控或基学习器拟合方向错误,甚至经验目标也不保证单调下降。
与 AdaBoost 的边界 ​
AdaBoost针对二分类指数损失给出特定样本权重与基分类器系数,并与弱到强学习理论紧密相连。Gradient Boosting 是更广的函数梯度框架,可使用平方、Huber、logistic 等损失和回归树。AdaBoost 可被解释为其中一个特殊方向,但其弱学习等价定理、训练错误指数界不能自动推广到任意梯度提升算法。
同样,“gradient”指经验风险对预测值的导数,不表示算法实现必须对树结构求可微梯度;树通过回归伪残差选择离散切分。
参考资料
- Jerome H. Friedman, “Greedy Function Approximation: A Gradient Boosting Machine,” Annals of Statistics, 2001.
- Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, boosting chapter.
- Robert E. Schapire and Yoav Freund, Boosting: Foundations and Algorithms, 2012.