Skip to content

模型Model

统计学习问题

Statistical learning problem

从未知分布的有限观测中选择决策规则,并以样本外表现评价其质量。

形式陈述 ​

设 (X,A) 是输入可测空间,(Y,B) 是标签空间,观测可测空间为 (Z,A⊗B),其中 Z=X×Y。一个批量监督学习问题还要固定允许的分布族 D、比较用的假设类 H、允许的输出类 G、损失 ℓ:(H∪G)×Z→[0,+∞],以及学习器 A。环境选择未知的 D∈D,学习器观察IID 样本

S=(Z1,…,Zm)∼Dm,

若算法使用独立随机种子 U,输出写成

h^=A(S,U)∈G.

若 A 的所有可能输出都属于 H,学习器就是 proper;improper 只表示不施加这项输出约束。常见做法是预先声明 G⊇H,但 improper 的定义不要求两个类具有这种包含关系。无论采用哪种输出类,比较基准仍须单独声明。对一份与 (S,U) 独立的新观测 Z∼D,总体风险为

RD(h^)=EZ∼D[ℓ(h^,Z)].

外层学习保证再对 S 与 U 取概率。通常假设损失和学习器具有足够的可测性;否则 RD(A(S,U)) 或成功事件本身可能不是可定义的随机量。

分布无关陈述的量词顺序是“存在同一个 A,对所有 D∈D,再对 S∼Dm 与 U 取概率”。训练集只是 Dm 的一次实现,不能把实现值当成已知分布,也不能为每个未知 D 另选一台预先知道它的算法。

直觉

二分类用 0–1 损失评价错误概率;平方回归评价数值偏差。共同协议并未强迫预测器是有限维参数,它也可以是树、查找规则或随机决策核。

已知完整目标函数后求最小值是优化问题;目标由未知分布定义、只能用样本近似,并须接受样本外评价时才出现学习层。假设类规定比较对象,损失规定何谓表现好,学习协议则规定算法实际看到了什么。这三层不能由某个优化器的名字代替。

IID 是本页主线而非学习的唯一可能:时间序列、自适应采样和分布漂移需要另写数据协议,不能沿用 Dm 的证明。样本复杂度随后把风险目标变成有限数据保证。

即使有无限数据,总体风险也不必趋零。下面 Bernoulli 例子中的不可消去项 p(1−p) 来自标签自身随机性;恢复了 p 也无法预知下一次标签,因此学习保证往往比较超额风险而非原始风险。

训练样本与独立总体评价
例子与边界

邮件分类与分布迁移 ​

一项完整的统计学习问题还必须固定信息边界。设邮件分类的 X 包含正文和发件域,Y 表示是否为垃圾邮件;训练样本若来自旧月份,而部署风险按新月份分布计算,就不再是同一个 D。即使训练误差为零,原 IID 保证也没有覆盖这种分布迁移。相反,若该月原始邮件本身是从同一个 D 独立采样的,再按独立于内容的随机方式划分训练和测试部分,且测试集始终封存,那么条件于训练过程,测试点仍可作独立风险评价。仅仅“随机切分”不能把原本存在用户聚类、时间依赖或选择偏差的数据变成 IID。

估计作为学习的特例 ​

令 Y∼Bernoulli(p),预测器是常数 a∈[0,1],损失为 (a−Y)2。总体风险可以逐项算出:

Rp(a)=p(a−1)2+(1−p)a2=(a−p)2+p(1−p).

唯一最优动作是 a=p,经验风险最小化器则是样本均值 p^=m−1∑iYi。若 m=4 且标签为 (1,0,1,0),经验准则是 [2(a−1)2+2a2]/4=(a−1/2)2+1/4,所以输出 p^=1/2。若未知真实参数恰为 p=0.8,总体风险为 0.25,最优总体风险为 p(1−p)=0.16,超额风险是 (0.5−0.8)2=0.09。算法能算出前一个经验二次式,却不能从这四条数据直接读出 p;风险分解是分析者对未知环境作的评价。

因此 Bernoulli 参数估计确实是常数预测器类上的平方损失学习,而不只是术语类比。

分布族边界 ​

最后还需规定允许的分布族。分布无关 PAC 允许全部满足可测性与损失条件的 D,minimax 估计常把 D 限制在参数族 {Pθ},协变量漂移则区分源训练分布与目标部署分布,假定给定输入的整个条件标签分布不变,并在目标输入由源输入覆盖时用密度比识别目标风险。限制越强,可能获得越快的速率;这些速率不能回填到未受限制的协议。

推论与应用

经验风险最小化把未知总体风险换成样本上可计算的目标;一致收敛、复杂度界或稳定性再负责证明这个替换对数据依赖输出仍可靠。算法成功需要两件事同时成立:经验目标确实被近似优化,经验量与总体量之间的桥也足够牢固。

PAC 可学习性进一步为本页协议加入 ε 精度、δ 置信度和样本复杂度量词。可实现与不可知版本选择不同的总体基准,VC 理论、PAC-Bayes 和算法稳定性则提供不同的泛化证明路线;它们共享本页对象,却不能省略各自的附加条件。

若数据改为逐轮到达、算法必须在结果揭示前行动,问题转向在线学习协议,评价也常改为相对比较器的遗憾;若未选动作的结果被隐藏,则进一步进入 bandit。批学习、在线学习和 bandit 采用不同的信息结构,不能把三者视为同一算法的运行模式标签。

参考资料
  • Shai Shalev-Shwartz, Shai Ben-David, Understanding Machine Learning, 2014, Chs. 2–3.
  • Mehryar Mohri et al., Foundations of Machine Learning, 2nd ed., 2018, Ch. 2.
关系图谱30 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例

类型化关系