Skip to content

预测器与假设类

Predictor · Hypothesis class

区分可用于预测的函数、函数集合及其参数表示。

定义

预测器是可测函数 h:XY^;假设类 HY^X 规定学习器搜索或比较的候选规则。二分类器与实值 score f:XR 不应混写:signf 才是分类函数,而平方、logistic 等损失可直接作用于 score。

参数化只是表示。若 hθ=hθ,两个参数仍是同一函数;隐藏单元置换便会造成这种重复。因此参数个数、参数集合基数和统计复杂度不是同一个量。

参数表示与样本行为

实线阈值类 ha(x)=1{xa} 有不可数多个参数,但在 m 个互异有序点上只有 m+1 种标注。类的有效表达力来自它能实现的行为,而不是“参数不可数”。

参数重复在一个简单模型中已经出现。令 hw,b(x)=sign(wx+b);把 (w,b) 同乘任意正数,分类函数完全不变。因此“半径不超过 100 的参数有更多模型”并不能直接推出分类函数更多,margin 分析还会把这种缩放商掉。反过来,实线阈值虽然只用一个参数,却能随样本位置连续移动;对有限样本真正重要的是它产生的不同限制模式。

score 与最终预测也属于不同层。实值函数 f 可以携带置信方向和幅度,分类器 signf 只保留决策;两个 score 即使给出相同分类,也可能在 logistic 损失下承担不同代价。讨论函数类时必须先说明类中装的是 score、标签预测还是动作分布。

比较类、搜索类与输出类

概念类常指允许生成标签的真规则,假设类则指学习器搜索、输出或比较的候选规则;在简单 ERM 中三者可以相同,但一般不能默认如此。算法可能在凸松弛空间中搜索,最终输出投票函数,却仍与原始离散类的最优风险比较。若不分别命名,就会把“优化器找到了松弛最优”误写成“原类 ERM 已求解”。

Proper learner 的最终输出属于指定假设类 H;improper learner 可以输出更大的类,却仍以 infhHR(h) 为基准。这个区分只约束输出与比较类的关系,不替代中间参数化或搜索空间的说明。随机化预测器则是从 x 到动作分布的 kernel,评价时还须对动作随机性取期望。

假设类也不等于训练算法。阈值类固定后,可以用扫描得到 ERM,也可以用一个表现较差的算法随便返回阈值;类的 VC 维没有改变,算法风险却不同。同样,两个算法可以搜索同一类但采用不同正则或 tie-breaking。讨论“模型是否可学”时应先确定函数类,再分别研究统计保证和求解过程。

表达力与可测性边界

取所有二元函数能记住任意有限样本,却对未见点没有可借用的共同结构;表达力最大不等于分布无关可学。这个失败来自函数类允许的行为,而不是“参数太多”这一句口号,具体容量和可学习性由后继页面刻画。

可测性问题在不可数类中尤其真实:suphH 或 argmin 未必是可测随机变量。常见教材用可数稠密子类、可分参数化或外概率避开病态集合。正文省略这些集合论技术时,至少应声明采用标准正则性条件。

参考资料
  • Vladimir Vapnik, Statistical Learning Theory, Wiley, 1998.
  • Shalev-Shwartz, Ben-David, Understanding Machine Learning, Chs. 2–3.