形式陈述
固定架构确定一族函数
ReLU 激活函数定义为 ,作用于向量时逐坐标计算。标准前馈 ReLU 网络由仿射映射与激活函数的复合公理库函数复合Function composition · Composition of maps按先 f 后 g 的次序把映射串联为 g∘f。构成:
输出层不再施加 ReLU。本页以输入、输出均为一维为主,令 ,隐藏层宽度为 。深度 计入输出层,表示仿射层数;隐藏层数则是 。标准架构没有输入直连输出的连接。
对指定架构 及允许的参数集合 ,相应的假设类公理库预测器与假设类Predictor · Hypothesis class区分可用于预测的函数、函数集合及其参数表示。为
固定架构只确定参数槽位, 还可规定范数界或固定某些系数。稠密架构的权重与偏置槽位总数为
一个槽位恰好取零,仍计入这个 ;而不同参数向量可能实现同一个函数。因此函数类、架构槽位数和某种简化表示的坐标数应分别记录。
一维折点表示定理
设 连续且分段仿射,只有有限个真实折点 。按从左到右的顺序,记各开区间上的斜率为 ,最左段为 ,并令 。则在整条实轴上,
这里“仿射”允许非零截距;文献中常把这类函数称为 piecewise linear。 时空和为零,得到普通仿射函数。
证明如下。记右端为 。在最左区间 ,所有 ReLU 项为零,所以 。在 上,前 个 ReLU 项已经开启,后面的仍为零,因此
其中最后一个区间按 理解。现在从左到右归纳:若前一段已经相等,由 的连续性公理库连续性Continuity · Continuous function函数在输入微小变化时输出可被控制为任意小变化的性质。可知它们在下一个折点的取值也相等;下一段又有相同斜率,故这一整段的截距与取值都相同。归纳覆盖所有区间及折点,得到 。反过来,有限个这样的 ReLU 项之和必为连续分段仿射函数;把相同位置的系数相加后,只有非零斜率跳跃的位置才是真实折点。
从表示式落实为网络
允许一条输入到输出的线性直连,即 skip 变体,浅网络写为
取 就实现上述函数,隐藏宽度为 。此架构有 个参数槽位;若直接用有序折点、跳跃、初始斜率与截距作为标准化表示,只需 个实数。这两个数分别描述架构与表示,含义不同。在这个带 skip 的单隐藏层模型中, 也是真实折点数所要求的宽度下界,因为一个隐藏单元至多贡献一个折点,仿射直连不贡献折点。
对于默认的标准网络,利用
替换 ,便得到宽度 、深度 的实现。其稠密参数数为 。这是对任意上述 都成立的构造上界;某些函数可用更窄的网络。例如 时可省掉这两个单元。若只要求有限区间 上精确表示,则 在该区间成立,计入区间内部的 个真实折点后,宽度 已足够。
直觉
是在 处开启的一段斜坡:左边斜率为零,右边斜率为一。乘上 后,它把此后的斜率统一增加 。因而构造目标折线时,只需先放好最左直线,再逐个补上斜率变化。连续性负责把各段接在同一高度,斜率跳跃负责改变方向。
这一解释也揭示了参数冗余。对一般单元 ,若 ,折点是 ,从左到右的斜率跳跃为 。当 时,左侧斜率为 、右侧为零,所以跳跃是 ;它还会改变最左段的仿射项。若 ,该单元仅给出常量。由此读网络时,要同时收集折点、跳跃和初始直线,不能只读取输出权重。
正齐次性 ()还允许把隐藏单元的输入系数乘以 ,并把输出系数除以 ,保持函数不变。同一折点处的多个跳跃也可能抵消。隐藏单元数因此记录实现规模,真实折点数记录函数形状。
例子与边界
三个折点恢复四段直线
取折点 ,最左直线 ,四段斜率依次为 。相邻斜率相减给出跳跃 ,故
逐段开启各项并合并,得到
三个连接点上的值分别为 ,每处相邻公式都一致。再代入 ,依次得到 ,可独立核对每一段。
从折点处的斜率跳跃恢复 ReLU 折线 图中的三个跳跃分别由 、、 提供。每个标注都是相邻两段斜率之差;它们与初始斜率 一起确定整条折线的方向变化,最左截距 再确定高度。
| 实现或表示 |
隐藏宽度 |
计数含义 |
本例数量 |
| 带线性 skip 的浅网络 |
|
稠密架构参数 |
|
| 标准无 skip 的安全构造 |
|
稠密架构参数 |
|
| 标准化折点表示 |
不另指定架构 |
折点、跳跃、初始斜率与截距 |
|
具体地,标准网络可取隐藏向量
以及输出 。五个隐藏单元各有一个输入权重和一个偏置,输出有五个权重和一个偏置,共 个槽位。若额外加入 ,函数完全不变;这对单元没有创造新折点。
精确表示的范围
有限 ReLU 网络由连续映射复合而成,所以不能在整条实轴上精确实现有跳跃的阶跃函数。它也不能在任何非空开区间上精确等于 :有限分段中必有一个非空开子区间落在同一仿射段内,而二次函数在该子区间上不可能是仿射的。这些结论讨论精确相等;逼近误差随着网络规模怎样变化,是另一个问题。
多层一维网络仍是连续分段仿射函数。若上一层在输入轴上已有 段,则在每一段内部,下一层的每个预激活都是仿射函数,至多有一个非恒零根; 个单元至多把该段切成 段。恒零预激活不会增加分段。由初始的一段归纳,最终仿射段数至多为
该上界说明深度如何增加潜在分段数,却没有保证所有断点位置和斜率都能独立指定。前面的浅层精确表示证明依赖一维折点的线性次序;多维函数的仿射区域具有不同几何,不能直接沿用这条证明。
推论与应用
从参数账本到组合容量
固定架构后,参数与深度可以进入伪维公理库伪维pseudo-dimension · Pollard dimension通过逐点阈值打散,把 VC 维推广到实值函数类。的容量上界。Bartlett、Harvey、Liaw 与 Mehrabian 对分段线性网络证明的结果给出:对有 个权重及偏置、 个计算层的固定 ReLU 架构,阈值分类类的 VC 维为 ,实值输出类的伪维也有同阶上界。这里采用与上文一致的、计入输出层的深度约定;限制允许参数集合只会缩小函数类。
这是所引文献的容量定理,并非折点表示式的直接推论。它没有把伪维等同于 ,也没有给每一个一维窄网络相同的下界。对本页的任务,折点表示回答怎样精确构造一个函数,容量定理回答整个架构能实现多丰富的样本行为。
有界平方损失下调用泛化界
令架构与参数集合在观察数据前固定,取独立同分布样本 ,假设 且 。把预测截断为 ,定义归一化损失类
每个损失值都在 内。在相应可测性条件下,Rademacher 泛化界公理库Rademacher 泛化界Rademacher generalization bound用样本上的 Rademacher 复杂度给出对整个有界实值函数类同时成立的数据依赖总体风险上界。因此可以直接应用。记
则对 ,以至少 的概率,同时对所有候选 有
这里 采用 的定义,随机符号 独立均匀取 ;复杂度作用于损失类 。归一化应用定理后再乘回 ,就是上式的全部换算。
这个保证控制截断预测的样本外风险。要得到有用的数值,还需控制复杂度项;有限参数与精确插值本身没有完成这一步。平方损失回归公理库回归学习与平方损失Regression learning · Square-loss regression · 平方损失回归以条件均值为 Bayes 预测器组织平方损失回归,并说明无界响应、噪声尾部与函数类复杂度如何共同决定风险保证。中的标签界、预测范围或尾部假设承担的正是这一角色。至于训练过程是否找到上述构造或低风险参数,还需要分析具体优化算法。
参考资料