No history yet

监督学习进阶

逻辑回归:从线性到概率

你已经熟悉线性回归,它通过拟合一条直线来预测连续值。但如果目标是分类,比如判断一封邮件是否为垃圾邮件,或者一个客户是否会流失,我们需要的是一个概率,而不是一个无界的数值。逻辑回归就是为此而生。

逻辑回归的核心思想是在线性回归的基础上,套上一个“压缩”函数,将线性方程的输出结果映射到 (0, 1) 区间内,这个结果便可以解释为概率。这个神奇的函数就是 Sigmoid 函数。

σ(z)=11+ez\sigma(z) = \frac{1}{1 + e^{-z}}

有了概率,我们如何评估模型的好坏呢?对于线性回归,我们用均方误差(MSE)来衡量预测值与真实值之间的差距。但对于逻辑回归,使用 MSE 并不是一个好选择,因为它会产生一个非凸的损失函数,使得找到全局最优解变得非常困难。取而代之的是对数似然损失,也常被称为二元交叉熵损失。

L(y,p^)=[ylog(p^)+(1y)log(1p^)]L(y, \hat{p}) = -[y \log(\hat{p}) + (1-y) \log(1-\hat{p})]

支持向量机:寻找最佳边界

逻辑回归试图找到一个决策边界来区分不同类别,但它并不关心这个边界离样本点有多“远”。而支持向量机(SVM)的目标则更为明确:它要找到一个能将两类样本分得最开的。这个“最开”的距离,就是所谓的“最大间隔”(Maximum Margin)。

Lesson image

那些恰好落在间隔边界上的数据点,被称为“支持向量”,它们是定义决策边界的关键。其他所有点,即使被移除,也不会影响这个最优边界的位置。这使得 SVM 在计算上非常高效,因为它只关心那些最难区分的“边界”点。

但在现实世界中,数据很少是完美线性可分的。总会有一些噪声或异常点混在其中。为了解决这个问题,SVM 引入了“软间隔”(Soft Margin)的概念。它允许一些样本点越过间隔边界,甚至被错误分类。我们通过一个超参数 [{]}(cost) 来控制这种容忍度。

软间隔通过引入“松弛变量”ξi0\xi_i \ge 0 来实现。每个样本点都有一个松弛变量,它衡量了该点“出格”的程度。目标函数不仅要最大化间隔,还要最小化所有松弛变量的总和。

核技巧:征服非线性

如果数据本身就是非线性的,比如一个环形分布的数据集,一条直线无论如何也无法完美分开。这时,(Kernel Trick)就派上了用场。它的核心思想是:在低维空间中线性不可分的数据,在映射到一个更高维的空间后,可能就变得线性可分了。

核技巧的绝妙之处在于,我们无需真正计算数据在新维度中的坐标,只需要定义一个核函数来计算数据点在新空间中的内积即可。这大大降低了计算的复杂性。

常见的核函数包括:

  • 多项式核 (Polynomial Kernel): K(xi,xj)=(γxiTxj+r)dK(x_i, x_j) = (\gamma x_i^T x_j + r)^d
  • 高斯径向基函数核 (RBF Kernel): K(xi,xj)=exp(γxixj2)K(x_i, x_j) = \exp(-\gamma ||x_i - x_j||^2)

RBF 核尤其强大,因为它能将数据映射到无限维空间,可以处理非常复杂的决策边界。

损失函数之争

逻辑回归和 SVM 在处理分类问题时都非常有效,但它们的“哲学”不同,这体现在它们的损失函数上。

  • 逻辑回归使用对数损失 (Log Loss)。
  • SVM 使用合页损失 (Hinge Loss)。
LHinge(y,z)=max(0,1yz)L_{Hinge}(y, z) = \max(0, 1 - yz)

从图中可以看出关键差异:

  • 鲁棒性:Hinge Loss 对远离决策边界的正确分类点“不闻不问”(损失为0),因此它对这些点的位置不敏感。这使得 SVM 对异常值(只要它们被正确分类且在间隔之外)的鲁棒性更强。
  • 概率解释:Log Loss 永远不会等于 0。即使一个点被非常自信地正确分类,Log Loss 仍然会给出一个微小的损失值,激励模型变得更加“确定”。这与逻辑回归输出概率的特性是一致的。

总而言之,如果你需要一个概率输出,逻辑回归是自然的选择。如果你更关心找到一个清晰的、鲁棒的决策边界,并且对异常值不那么敏感,SVM 可能是更好的工具。

Quiz Questions 1/5

逻辑回归与线性回归的主要区别在于,它通过一个______函数将线性输出转换为概率。

Quiz Questions 2/5

在支持向量机(SVM)中,定义了最优决策边界位置的关键数据点被称为: