本模块将介绍线性回归概念。
线性回归是一种用于查找变量之间关系的统计技术。在机器学习背景下,线性回归用于查找特征与标签之间的关系。
例如,假设我们想根据汽车的重量预测汽车的燃油效率(以每加仑英里数表示),并且我们有以下数据集:
| 以千为单位的磅数(特征) | 每加仑英里数(标签) |
|---|---|
| 3.5 | 18 |
| 3.69 | 15 |
| 3.44 | 18 |
| 3.43 | 16 |
| 4.34 | 15 |
| 4.42 | 14 |
| 2.37 | 24 |
如果我们绘制这些点,会得到以下图表:
图 1. 汽车重量(以磅为单位)与每加仑汽油能行驶的英里数评级。汽车越重,每加仑燃油行驶里程数通常越低。
我们可以通过在这些点之间绘制最佳拟合线来创建自己的模型:
图 2. 通过上图数据绘制的最佳拟合线。
线性回归方程
用代数术语来说,该模型可定义为 $ y = mx + b $,其中
- $ y $ 是每加仑燃油行驶里程数,即我们要预测的值。
- $ m $ 是直线的斜率。
- $ x $ 是磅,即我们的输入值。
- $ b $ 是 y 轴截距。
在机器学习中,线性回归模型的方程式如下所示:
$$ y' = b + w_1x_1 $$