《Machine Learning in Action》—— 浅谈线性回归的那些事
《Machine Learning in Action》—— 浅谈线性回归的那些事大家好我是你们的老朋友一个天天和代码、数据打交道的技术博主。今天我们来聊聊机器学习里的一个经典话题——线性回归。别看它名字里带个“线性”就觉得它简单到不值一提。实际上线性回归是机器学习入门的基石也是很多复杂算法比如逻辑回归、神经网络的“老祖宗”。《Machine Learning in Action》这本书相信很多搞ML的朋友都翻过。它讲线性回归的方式非常接地气不跟你整一堆晦涩的数学公式而是直接告诉你“线性回归就是找一条直线让所有数据点离这条直线尽可能近。”今天我就用这本书的精神带大家把线性回归的那些事掰扯清楚。## 什么是线性回归一个生活化的比喻想象一下你是一个房产中介。你手里有一堆房子的数据面积x和价格y。你想建立一个模型告诉客户“如果房子面积是100平米大概能卖多少钱”这时候线性回归就派上用场了。线性回归假设房价和面积之间的关系是线性的也就是一条直线y wx b其中-w是斜率权重表示面积每增加1平米价格涨多少。-b是截距表示面积为0时的价格虽然现实中不可能但数学上需要。我们的目标就是找到最合适的w和b让这条直线尽可能穿过所有数据点。怎么衡量“尽可能”呢答案是最小化误差。最常见的误差度量是均方误差MSE即所有点到直线的垂直距离的平方和。## 怎么求解 w 和 b两种江湖流派在《Machine Learning in Action》里作者介绍了两种主流的求解方法正规方程法和梯度下降法。我们来分别看看。### 1. 正规方程法一步到位但怕大数据正规方程法直接用数学公式求解一步到位。对于一个数据集我们把它写成矩阵形式X是特征矩阵每行一个样本第一列全是1用来对应截距by是目标值向量。那么最优的权重向量θ为θ (X^T X)^(-1) X^T y这个公式推导简单但有个致命缺点当特征数量很多比如上万时计算 (X^T X) 的逆矩阵非常慢甚至内存爆炸。所以它适合小数据大数据请用下一种。### 2. 梯度下降法慢慢走终会到梯度下降法是一种迭代优化算法。它的思想很简单从某个随机点出发沿着误差函数下降最快的方向梯度负方向迈出一小步然后重复直到误差足够小。步骤1. 初始化权重比如全0。2. 计算当前误差对每个权重的偏导数梯度。3. 更新权重w w - learning_rate * 梯度。4. 重复第2、3步直到收敛。学习率learning_rate是关键参数太大可能跳过最优解太小则收敛太慢。## 代码示例从零实现线性回归光说不练假把式。我们直接用Python实现一个简单的线性回归分别用正规方程和梯度下降来求解。代码里我加了详细注释方便你理解。### 示例1正规方程法pythonimport numpy as npimport matplotlib.pyplot as plt# 生成模拟数据y 2*x 3 噪声np.random.seed(42)X 2 * np.random.rand(100, 1) # 100个样本每个样本1个特征y 4 3 * X np.random.randn(100, 1) # 真实斜率3截距4加上高斯噪声# 正规方程求解# 在X前面加一列1用来对应截距项X_b np.c_[np.ones((100, 1)), X] # 形状 (100, 2)# 计算最优权重: theta (X^T X)^(-1) X^T ytheta_best np.linalg.inv(X_b.T.dot(X_b)).dot(X_b.T).dot(y)print(正规方程求解结果)print(截距 (b):, theta_best[0][0])print(斜率 (w):, theta_best[1][0])# 画出拟合直线X_new np.array([[0], [2]])X_new_b np.c_[np.ones((2, 1)), X_new]y_predict X_new_b.dot(theta_best)plt.scatter(X, y, alpha0.6, label数据点)plt.plot(X_new, y_predict, r-, linewidth2, label拟合直线)plt.xlabel(X)plt.ylabel(y)plt.legend()plt.title(正规方程法拟合结果)plt.show()运行这段代码你会看到一条红色的直线穿过数据点截距和斜率分别接近4和3——和我们的真实参数基本一致。正规方程法干净利落一步搞定。### 示例2梯度下降法pythonimport numpy as npimport matplotlib.pyplot as plt# 使用相同的数据np.random.seed(42)X 2 * np.random.rand(100, 1)y 4 3 * X np.random.randn(100, 1)# 添加偏置项截距X_b np.c_[np.ones((100, 1)), X]# 梯度下降参数learning_rate 0.1 # 学习率n_iterations 1000 # 迭代次数m len(X_b) # 样本数量# 随机初始化权重theta np.random.randn(2, 1)# 记录每次迭代的误差用于可视化cost_history []for iteration in range(n_iterations): # 计算预测值 y_pred X_b.dot(theta) # 计算梯度对所有样本的平均梯度 gradients (2/m) * X_b.T.dot(y_pred - y) # 更新权重 theta theta - learning_rate * gradients # 记录当前均方误差MSE cost (1/(2*m)) * np.sum((y_pred - y)**2) cost_history.append(cost)print(梯度下降求解结果)print(截距 (b):, theta[0][0])print(斜率 (w):, theta[1][0])# 画出误差下降曲线plt.plot(range(n_iterations), cost_history)plt.xlabel(迭代次数)plt.ylabel(均方误差 (MSE))plt.title(梯度下降误差下降曲线)plt.show()这段代码展示了梯度下降的迭代过程。你会看到误差曲线一开始下降很快然后逐渐平缓最终收敛到最小值。注意这里的学习率是0.1如果改成1.0可能会发散如果改成0.001则收敛极慢。调参是门艺术。## 线性回归的实战陷阱与技巧在实际应用中线性回归有几点需要注意### 1. 特征缩放如果特征取值范围差异很大比如一个特征0-1另一个0-10000梯度下降会非常慢甚至不收敛。解决方法标准化或归一化。### 2. 过拟合 vs 欠拟合线性回归容易欠拟合因为假设太简单但加入高阶特征如x^2后也可能过拟合。这时候可以用正则化如岭回归、Lasso来约束权重。### 3. 异常值敏感均方误差对异常值非常敏感因为平方放大了误差。如果数据有离群点可以考虑用绝对误差MAE代替MSE或者先做数据清洗。## 总结线性回归虽然简单但它是理解更复杂模型的基础。从《Machine Learning in Action》的角度来看它的核心思想就两句话1. 用一条直线拟合数据2. 用最小二乘法或梯度下降找到最优直线。今天我们用正规方程和梯度下降两种方法实现了线性回归并看到了它们的区别正规方程适合小数据一步到位梯度下降适合大数据需要调参。希望这些代码和讲解能帮你打通线性回归的“任督二脉”。下次遇到房价预测、销量分析这类问题别慌先试试线性回归说不定它就是你想要的“银弹”。如果你觉得这篇文章有帮助欢迎点赞、收藏、转发我们下期再见

相关新闻

专业级AI图像修复工具:Real-ESRGAN-GUI的深度应用指南

专业级AI图像修复工具:Real-ESRGAN-GUI的深度应用指南

专业级AI图像修复工具:Real-ESRGAN-GUI的深度应用指南 【免费下载链接】Real-ESRGAN-GUI Lovely Real-ESRGAN / Real-CUGAN GUI Wrapper 项目地址: https://gitcode.com/gh_mirrors/re/Real-ESRGAN-GUI Real-ESRGAN-GUI是一款基于Flutter开发的跨平台桌面应用…

2026/7/25 20:00:38阅读更多 →
Taotoken CLI工具如何一键配置多开发环境下的AI代理设置

Taotoken CLI工具如何一键配置多开发环境下的AI代理设置

Taotoken CLI工具如何一键配置多开发环境下的AI代理设置 基础教程类,介绍Taotoken提供的命令行工具,演示开发者如何通过npx命令运行交互式菜单,快速为本地项目或服务器环境配置OpenAI兼容的API端点与密钥,该工具也支持为Claude C…

2026/7/25 20:00:38阅读更多 →
Pearcleaner:终极 macOS 清理工具完全指南 - 彻底释放磁盘空间的智能解决方案

Pearcleaner:终极 macOS 清理工具完全指南 - 彻底释放磁盘空间的智能解决方案

Pearcleaner:终极 macOS 清理工具完全指南 - 彻底释放磁盘空间的智能解决方案 【免费下载链接】Pearcleaner A free, source-available and fair-code licensed mac app cleaner 项目地址: https://gitcode.com/gh_mirrors/pe/Pearcleaner 你是否曾为 macOS …

2026/7/25 20:00:38阅读更多 →
如何永久保存微信聊天记录:WeChatMsg完整数据管理指南

如何永久保存微信聊天记录:WeChatMsg完整数据管理指南

如何永久保存微信聊天记录:WeChatMsg完整数据管理指南 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/WeCha…

2026/7/25 21:14:56阅读更多 →
如何快速掌握RSEM:RNA-Seq定量分析的终极实用指南

如何快速掌握RSEM:RNA-Seq定量分析的终极实用指南

如何快速掌握RSEM:RNA-Seq定量分析的终极实用指南 【免费下载链接】RSEM RSEM: accurate quantification of gene and isoform expression from RNA-Seq data 项目地址: https://gitcode.com/gh_mirrors/rs/RSEM 你是否正在为RNA-Seq数据的基因表达定量分析而…

2026/7/25 21:14:56阅读更多 →
免费开源离线绘图神器:draw.io桌面版完全指南

免费开源离线绘图神器:draw.io桌面版完全指南

免费开源离线绘图神器:draw.io桌面版完全指南 【免费下载链接】drawio-desktop Official electron build of draw.io 项目地址: https://gitcode.com/GitHub_Trending/dr/drawio-desktop 还在为寻找一款功能强大、完全免费且支持离线的绘图工具而烦恼吗&…

2026/7/25 21:14:56阅读更多 →
MySQL 8 安装与配置全指南:从环境变量到身份验证插件的实战详解

MySQL 8 安装与配置全指南:从环境变量到身份验证插件的实战详解

MySQL 8 的安装,对很多开发者来说,本该是“下一步、下一步”的简单操作,但实际动手时,却常常卡在环境变量、初始化密码、身份验证插件这些看似不起眼的环节上。网上教程版本混杂,照着做却启动失败,最后不得…

2026/7/25 21:14:56阅读更多 →
CentOS 7下yum安装wget失败的排查与解决

CentOS 7下yum安装wget失败的排查与解决

1. 问题现象与初步排查最近在CentOS 7服务器上遇到一个典型问题:尝试使用yum安装wget时,系统提示"无法执行操作"。这种情况在运维工作中其实相当常见,但背后的原因可能各不相同。第一次遇到这个报错时,我习惯性地先检查…

2026/7/25 21:14:56阅读更多 →
YOLO13-C3k2-OREPA模型:提升玻璃制品检测精度的关键技术

YOLO13-C3k2-OREPA模型:提升玻璃制品检测精度的关键技术

1. 项目背景与核心价值 玻璃物品检测在工业质检和智能家居领域一直是个棘手问题。传统检测方法对透明材质的识别准确率普遍低于60%,而基于普通YOLO模型的方案又存在小目标漏检和误报率高的问题。去年我在参与一个智能仓储项目时,就遇到过玻璃瓶检测准确率…

2026/7/25 21:12:55阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/25 1:01:14阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/25 1:01:14阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/25 1:01:14阅读更多 →
突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:01:16阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:01:16阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:01:16阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/24 23:01:03阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/25 19:03:04阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/25 19:03:04阅读更多 →