“局部化时,只对围绕低风险解的子类计算熵积分,可进入局部 Rademacher 复杂度和 fast rate。这里需要额外的方差—均值关系,而不是简单把全局 $F$ 换成一个看起来更小的集合。”
全局界为何会浪费信息 ​
全局 Rademacher 复杂度对整个函数类取上确界,无论其中的函数离最优解多远。经验风险最小化真正可能输出的却通常只是低经验风险区域。若远处函数极其丰富、近最优区域相当规整,全局界会让这些不可能胜出的函数抬高所有候选的复杂度,最终只得到常见的
局部化的想法是让统计半径与复杂度互相约束:先只看方差、
一种标准定义 ​
令
对
相应的期望局部复杂度为
也可用
次根函数与不动点 ​
分析常用一个非负、单调的上界函数
并要求
那么
典型高概率结果在适当有界性和 Bernstein 条件下呈现为
其中
一个快速度图像 ​
有限类
则风险不超过
求解
比全局
证明机制 ​
局部证明通常把类按风险或方差切成几何壳层,例如
实际应用还需要把不可观测的总体局部类换成经验可计算版本。常见定理证明经验不动点与总体不动点以高概率相互控制;这一步依赖有界差分或集中不等式,不能把从同一数据算出的随机半径直接当作确定阈值。
边界 ​
局部复杂度不是把全局公式中的
“fast rate”也不是优化收敛更快。它描述样本数增加时的统计超额风险,而非梯度法迭代次数。优化误差若大于
参考资料
- Peter L. Bartlett, Olivier Bousquet, and Shahar Mendelson, “Local Rademacher Complexities,” Annals of Statistics, 2005.
- Vladimir Koltchinskii, Oracle Inequalities in Empirical Risk Minimization, 2011.
- Martin Wainwright, High-Dimensional Statistics, localized complexity chapters.