形式陈述
定义
对非空实值函数类公理库预测器与假设类Predictor · Hypothesis class区分可用于预测的函数、函数集合及其参数表示。 ,其中 是实数域公理库实数系Real number system · Ordered complete field满足序域公理与上确界完备性的数系。,若存在点 和各自阈值 ,使对每个 都有某个 满足
就称这些点被 伪打散。最大的 是 ;不存在最大值时为无穷。
子图类的等价形式
令
则伪维等于子图集合类 的VC 维公理库VC 维Vapnik–Chervonenkis dimension · VC dimension二分类假设类能够完全打散的最大有限点集大小。。这把实值问题转成扩充空间 上的二元打散。
直觉
每个样本点都带一根可独立设定高度的横杆 ,函数图像要能按任意二进制模式越过或低于这些横杆。阈值随点变化,使伪维捕捉实值函数在不同位置的相对高度,而不是只问同一个水平切片能形成多少分类。
子图转换把 当作扩充空间中的二分类点:函数值是否越过阈值,等价于该点是否落入函数子图。于是 VC 维的组合工具可以复用,但输出范围与损失尾部仍属于回归问题的额外条件。
例子与边界
线性函数例子
对无截距线性类 ,,伪维为 ;在全域 上加入自由截距后,伪维恰为 。下界可选择 个线性无关公理库线性无关Linear independence只有全零系数能产生零向量的向量组。的输入、阈值全取零,再解线性方程实现每种符号。
上界不能只引用扩充空间中所有仿射半空间的维数,那会丢掉本类的约束。对任意 个输入,取不全为零的系数 使 。于是所有 都有 。按 的正负选择两种相反的阈值标注,分别要求这个零值至少为 、至多为该值,且至少一侧严格,因而不可能两种都实现。
加入截距后,对增广输入 使用同一论证,得到上界 。下界取输入 ,阈值仍全为零:对任意指定的 ,令截距为 、,便有 、,实现全部标注。这里的结论依赖函数族的具体表示能力,而不是“有 个参数所以必然等于 ”。
与相邻维度的区别
若只允许一个统一阈值 ,得到的是不同的阈值维度,不能替代逐点 。伪维适合回归和实值损失类;fat-shattering dimension 还引入正 margin,更能刻画尺度敏感的实值复杂度。对二元 值类,取阈值 后伪维退化为 VC 维。
边界
有限伪维只约束组合丰富度。要从它推出平方损失或绝对损失的风险界,通常还需输出有界、尾部条件或截断;无界函数可让少量极端值主导风险。不同参数可能表示同一函数,神经网络等类的伪维也未必等于裸参数数目。
ReLU 网络函数类公理库ReLU 网络函数类ReLU network function class · 一维 ReLU 折点表示从固定架构的函数集合出发,用斜率跳跃证明一维连续分段仿射函数的精确 ReLU 表示,并核对宽度、参数与泛化条件。把这些区别落实到固定架构:先分别核对标准网络与带线性直连网络的参数数,再引用依赖参数数与深度的容量上界,最后在预测截断和标签有界的条件下调用平方风险泛化界。这样,表达一个函数所需的表示、整个类的组合容量和损失的统计控制各有明确位置。
推论与应用
伪维是回归函数类的一项组合复杂度,而不是损失函数或估计器本身。
将伪维用于泛化时,还要把函数输出范围传到损失类。绝对损失需要 Lipschitz 与包络控制,平方损失的 Lipschitz 常数则依赖预测和标签界;若响应重尾,应先引入截断或稳健估计,不能只引用有限伪维。
参考资料
- David Pollard, Convergence of Stochastic Processes, Springer, 1984.
- Martin Anthony, Peter L. Bartlett, Neural Network Learning: Theoretical Foundations, Cambridge University Press, 1999.