Skip to content

定义Definition

ReLU 网络函数类

ReLU network function class · 一维 ReLU 折点表示

从固定架构的函数集合出发,用斜率跳跃证明一维连续分段仿射函数的精确 ReLU 表示,并核对宽度、参数与泛化条件。

形式陈述 ​

固定架构确定一族函数 ​

ReLU 激活函数定义为 σ(t)=max{t,0},作用于向量时逐坐标计算。标准前馈 ReLU 网络由仿射映射与激活函数的复合构成:

z0=x,zℓ=σ(Wℓzℓ−1+bℓ)(1≤ℓ≤h),fθ(x)=Wh+1zh+bh+1.

输出层不再施加 ReLU。本页以输入、输出均为一维为主,令 d0=dh+1=1,隐藏层宽度为 dℓ=nℓ。深度 D=h+1 计入输出层,表示仿射层数;隐藏层数则是 h。标准架构没有输入直连输出的连接。

对指定架构 A 及允许的参数集合 Θ,相应的假设类为

FA,Θ={fθ:θ∈Θ}.

固定架构只确定参数槽位,Θ 还可规定范数界或固定某些系数。稠密架构的权重与偏置槽位总数为

P=∑ℓ=1h+1dℓ(dℓ−1+1).

一个槽位恰好取零,仍计入这个 P;而不同参数向量可能实现同一个函数。因此函数类、架构槽位数和某种简化表示的坐标数应分别记录。

一维折点表示定理 ​

设 f:R→R 连续且分段仿射,只有有限个真实折点 t1<⋯<tK。按从左到右的顺序,记各开区间上的斜率为 s0,…,sK,最左段为 b+s0x,并令 Δj=sj−sj−1≠0。则在整条实轴上,

f(x)=b+s0x+∑j=1KΔjσ(x−tj).

这里“仿射”允许非零截距;文献中常把这类函数称为 piecewise linear。K=0 时空和为零,得到普通仿射函数。

证明如下。记右端为 g。在最左区间 x<t1,所有 ReLU 项为零,所以 g=f=b+s0x。在 (ti,ti+1) 上,前 i 个 ReLU 项已经开启,后面的仍为零,因此

slope(g)=s0+∑j=1iΔj=si.

其中最后一个区间按 tK+1=+∞ 理解。现在从左到右归纳:若前一段已经相等,由 f,g 的连续性可知它们在下一个折点的取值也相等;下一段又有相同斜率,故这一整段的截距与取值都相同。归纳覆盖所有区间及折点,得到 f=g。反过来,有限个这样的 ReLU 项之和必为连续分段仿射函数;把相同位置的系数相加后,只有非零斜率跳跃的位置才是真实折点。

从表示式落实为网络 ​

允许一条输入到输出的线性直连,即 skip 变体,浅网络写为

f(x)=b+ax+∑j=1Kcjσ(wjx+dj).

取 a=s0,cj=Δj,wj=1,dj=−tj 就实现上述函数,隐藏宽度为 K。此架构有 3K+2 个参数槽位;若直接用有序折点、跳跃、初始斜率与截距作为标准化表示,只需 2K+2 个实数。这两个数分别描述架构与表示,含义不同。在这个带 skip 的单隐藏层模型中,K 也是真实折点数所要求的宽度下界,因为一个隐藏单元至多贡献一个折点,仿射直连不贡献折点。

对于默认的标准网络,利用

x=σ(x)−σ(−x)

替换 ax,便得到宽度 K+2、深度 2 的实现。其稠密参数数为 3(K+2)+1=3K+7。这是对任意上述 f 都成立的构造上界;某些函数可用更窄的网络。例如 s0=0 时可省掉这两个单元。若只要求有限区间 [A,B] 上精确表示,则 x=σ(x−A)+A 在该区间成立,计入区间内部的 K 个真实折点后,宽度 K+1 已足够。

直觉

σ(x−t) 是在 t 处开启的一段斜坡:左边斜率为零,右边斜率为一。乘上 Δ 后,它把此后的斜率统一增加 Δ。因而构造目标折线时,只需先放好最左直线,再逐个补上斜率变化。连续性负责把各段接在同一高度,斜率跳跃负责改变方向。

这一解释也揭示了参数冗余。对一般单元 cσ(wx+d),若 w≠0,折点是 t=−d/w,从左到右的斜率跳跃为 c|w|。当 w<0 时,左侧斜率为 cw、右侧为零,所以跳跃是 −cw;它还会改变最左段的仿射项。若 w=0,该单元仅给出常量。由此读网络时,要同时收集折点、跳跃和初始直线,不能只读取输出权重。

正齐次性 σ(λu)=λσ(u)(λ>0)还允许把隐藏单元的输入系数乘以 λ,并把输出系数除以 λ,保持函数不变。同一折点处的多个跳跃也可能抵消。隐藏单元数因此记录实现规模,真实折点数记录函数形状。

例子与边界

三个折点恢复四段直线 ​

取折点 (−1,1,2),最左直线 1+2x,四段斜率依次为 (2,−1,3,0)。相邻斜率相减给出跳跃 (−3,4,−3),故

f(x)=1+2x−3σ(x+1)+4σ(x−1)−3σ(x−2).

逐段开启各项并合并,得到

f(x)={1+2x,x≤−1,−x−2,−1≤x≤1,3x−6,1≤x≤2,0,x≥2.

三个连接点上的值分别为 −1,−3,0,每处相邻公式都一致。再代入 x=−2,0,1.5,3,依次得到 −3,−2,−1.5,0,可独立核对每一段。

从折点处的斜率跳跃恢复 ReLU 折线

图中的三个跳跃分别由 −3σ(x+1)、4σ(x−1)、−3σ(x−2) 提供。每个标注都是相邻两段斜率之差;它们与初始斜率 2 一起确定整条折线的方向变化,最左截距 1 再确定高度。

实现或表示 隐藏宽度 计数含义 本例数量
带线性 skip 的浅网络 3 稠密架构参数 3K+2 11
标准无 skip 的安全构造 5 稠密架构参数 3K+7 16
标准化折点表示 不另指定架构 折点、跳跃、初始斜率与截距 2K+2 8

具体地,标准网络可取隐藏向量

z=(σ(x+1),σ(x−1),σ(x−2),σ(x),σ(−x))

以及输出 1+(−3,4,−3,2,−2)z⊤。五个隐藏单元各有一个输入权重和一个偏置,输出有五个权重和一个偏置,共 10+6=16 个槽位。若额外加入 4σ(x−1)−4σ(x−1),函数完全不变;这对单元没有创造新折点。

精确表示的范围 ​

有限 ReLU 网络由连续映射复合而成,所以不能在整条实轴上精确实现有跳跃的阶跃函数。它也不能在任何非空开区间上精确等于 x2:有限分段中必有一个非空开子区间落在同一仿射段内,而二次函数在该子区间上不可能是仿射的。这些结论讨论精确相等;逼近误差随着网络规模怎样变化,是另一个问题。

多层一维网络仍是连续分段仿射函数。若上一层在输入轴上已有 R 段,则在每一段内部,下一层的每个预激活都是仿射函数,至多有一个非恒零根;nℓ 个单元至多把该段切成 nℓ+1 段。恒零预激活不会增加分段。由初始的一段归纳,最终仿射段数至多为

∏ℓ=1h(nℓ+1).

该上界说明深度如何增加潜在分段数,却没有保证所有断点位置和斜率都能独立指定。前面的浅层精确表示证明依赖一维折点的线性次序;多维函数的仿射区域具有不同几何,不能直接沿用这条证明。

推论与应用

从参数账本到组合容量 ​

固定架构后,参数与深度可以进入伪维的容量上界。Bartlett、Harvey、Liaw 与 Mehrabian 对分段线性网络证明的结果给出:对有 P 个权重及偏置、D 个计算层的固定 ReLU 架构,阈值分类类的 VC 维为 O(PDlog⁡(P+1)),实值输出类的伪维也有同阶上界。这里采用与上文一致的、计入输出层的深度约定;限制允许参数集合只会缩小函数类。

这是所引文献的容量定理,并非折点表示式的直接推论。它没有把伪维等同于 P,也没有给每一个一维窄网络相同的下界。对本页的任务,折点表示回答怎样精确构造一个函数,容量定理回答整个架构能实现多丰富的样本行为。

有界平方损失下调用泛化界 ​

令架构与参数集合在观察数据前固定,取独立同分布样本 S=((Xi,Yi))i=1N,假设 |Y|≤M 且 M>0。把预测截断为 f¯(x)=max{−M,min{M,f(x)}},定义归一化损失类

G={(x,y)↦(f¯(x)−y)24M2:f∈FA,Θ}.

每个损失值都在 [0,1] 内。在相应可测性条件下,Rademacher 泛化界因此可以直接应用。记

R(f¯)=E(f¯(X)−Y)2,R^S(f¯)=1N∑i=1N(f¯(Xi)−Yi)2.

则对 0<δ<1,以至少 1−δ 的概率,同时对所有候选 f 有

R(f¯)≤R^S(f¯)+4M2[2R^S(G)+3log⁡(2/δ)2N].

这里 R^S 采用 N−1∑iεig(Xi,Yi) 的定义,随机符号 εi 独立均匀取 {−1,1};复杂度作用于损失类 G。归一化应用定理后再乘回 4M2,就是上式的全部换算。

这个保证控制截断预测的样本外风险。要得到有用的数值,还需控制复杂度项;有限参数与精确插值本身没有完成这一步。平方损失回归中的标签界、预测范围或尾部假设承担的正是这一角色。至于训练过程是否找到上述构造或低风险参数,还需要分析具体优化算法。

参考资料
关系图谱7 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系