线性回归

本模块将介绍线性回归概念。

线性回归是一种用于查找变量之间关系的统计技术。在机器学习背景下,线性回归用于查找特征标签之间的关系。

例如,假设我们想根据汽车的重量预测汽车的燃油效率(以每加仑英里数表示),并且我们有以下数据集:

以千为单位的磅数(特征) 每加仑英里数(标签)
3.5 18
3.69 15
3.44 18
3.43 16
4.34 15
4.42 14
2.37 24

如果我们绘制这些点,会得到以下图表:

图 1. 数据点显示从左到右的下降趋势。

图 1. 汽车重量(以磅为单位)与每加仑汽油能行驶的英里数评级。汽车越重,每加仑燃油行驶里程数通常越低。

我们可以通过在这些点之间绘制最佳拟合线来创建自己的模型:

图 2. 数据点,其中绘制了一条最合适的直线来表示模型。

图 2. 通过上图数据绘制的最佳拟合线。

线性回归方程

用代数术语来说,该模型可定义为 $ y = mx + b $,其中

  • $ y $ 是每加仑燃油行驶里程数,即我们要预测的值。
  • $ m $ 是直线的斜率。
  • $ x $ 是磅,即我们的输入值。
  • $ b $ 是 y 轴截距。

在机器学习中,线性回归模型的方程式如下所示:

$$ y' = b + w_1x_1 $$