“若 $ Y \le M$ 且把预测截断到 $[ M,M]$,平方损失落在 $[0,4M^2]$。截断不会增加平方风险,因为对区间内的标签,投影只会缩短残差。此后才可对损失类使用有界集中或一致…”
形式陈述 ​
定义 ​
对实值函数类
就称这些点被
子图类的等价形式 ​
每个样本点都带一根可独立设定高度的横杆
则伪维等于子图集合类
直觉
每个样本点都带一根可独立设定高度的横杆
子图转换把
例子与边界
线性函数例子 ​
对无截距线性类
与相邻维度的区别 ​
若只允许一个统一阈值
边界 ​
有限伪维只约束组合丰富度。要从它推出平方损失或绝对损失的风险界,通常还需输出有界、尾部条件或截断;无界函数可让少量极端值主导风险。不同参数可能表示同一函数,神经网络等类的伪维也未必等于裸参数数目。
推论与应用
对二元函数类,取阈值
将伪维用于泛化时,还要把函数输出范围传到损失类。绝对损失需要 Lipschitz 与包络控制,平方损失的 Lipschitz 常数则依赖预测和标签界;若响应重尾,应先引入截断或稳健估计,不能只引用有限伪维。
参考资料
- David Pollard, Convergence of Stochastic Processes, Springer, 1984.
- Martin Anthony, Peter L. Bartlett, Neural Network Learning: Theoretical Foundations, Cambridge University Press, 1999.