sklearn.linear_model.LogisticRegression()函数解析(最清晰的解释)
欢迎关注WX公众号【程序员管小亮】sklearn.linear_model.LogisticRegression()函数全称是Logistic回归aka logitMaxEnt分类器。classsklearn.linear_model.LogisticRegression(penaltyl2,dualFalse,tol0.0001,C1.0,fit_interceptTrue,intercept_scaling1,class_weightNone,random_stateNone,solverlbfgs,max_iter100,multi_classauto,verbose0,warm_startFalse,n_jobsNone,l1_ratioNone)参数penalty惩罚项str类型可选参数为l1和l2默认为l2。用于指定惩罚项中使用的规范。newton-cg、sag和lbfgs求解算法只支持L2规范。L1G规范假设的是模型的参数满足拉普拉斯分布L2假设的模型参数满足高斯分布所谓的范式就是加上对参数的约束使得模型更不会过拟合(overfit)但是如果要说是不是加了约束就会好这个没有人能回答只能说加约束的情况下理论上应该可以获得泛化能力更强的结果。dual对偶或原始方法bool类型默认为False。对偶方法只用在求解线性多核(liblinear)的L2惩罚项上。当样本数量样本特征的时候dual通常设置为False。tol停止求解的标准float类型默认为1e-4。就是求解到多少的时候停止认为已经求出最优解。c正则化系数λ的倒数float类型默认为1.0。必须是正浮点型数。像SVM一样越小的数值表示越强的正则化。fit_intercept是否存在截距或偏差bool类型默认为True。intercept_scaling仅在正则化项为”liblinear”且fit_intercept设置为True时有用。float类型默认为1。class_weight用于标示分类模型中各种类型的权重可以是一个字典或者balanced字符串默认为不输入也就是不考虑权重即为None。如果选择输入的话可以选择balanced让类库自己计算类型权重或者自己输入各个类型的权重。举个例子比如对于0,1的二元模型我们可以定义class_weight{0:0.9,1:0.1}这样类型0的权重为90%而类型1的权重为10%。如果class_weight选择balanced那么类库会根据训练样本量来计算权重。某种类型样本量越多则权重越低样本量越少则权重越高。当class_weight为balanced时类权重计算方法如下n_samples / (n_classes * np.bincount(y))。n_samples为样本数n_classes为类别数量np.bincount(y)会输出每个类的样本数例如y[1,0,0,1,1],则np.bincount(y)[2,3]。那么class_weight有什么作用呢 在分类模型中我们经常会遇到两类问题第一种是误分类的代价很高。比如对合法用户和非法用户进行分类将非法用户分类为合法用户的代价很高我们宁愿将合法用户分类为非法用户这时可以人工再甄别但是却不愿将非法用户分类为合法用户。这时我们可以适当提高非法用户的权重。第二种是样本是高度失衡的比如我们有合法用户和非法用户的二元样本数据10000条里面合法用户有9995条非法用户只有5条如果我们不考虑权重则我们可以将所有的测试集都预测为合法用户这样预测准确率理论上有99.95%但是却没有任何意义。这时我们可以选择balanced让类库自动提高非法用户样本的权重。提高了某种分类的权重相比不考虑权重会有更多的样本分类划分到高权重的类别从而可以解决上面两类问题。random_state随机数种子int类型可选参数默认为无仅在正则化优化算法为sag,liblinear时有用。solver优化算法选择参数只有五个可选参数即newton-cg,lbfgs,liblinear,sag,saga。默认为liblinear。solver参数决定了我们对逻辑回归损失函数的优化方法有四种算法可以选择分别是liblinear使用了开源的liblinear库实现内部使用了坐标轴下降法来迭代优化损失函数。lbfgs拟牛顿法的一种利用损失函数二阶导数矩阵即海森矩阵来迭代优化损失函数。newton-cg也是牛顿法家族的一种利用损失函数二阶导数矩阵即海森矩阵来迭代优化损失函数。sag即随机平均梯度下降是梯度下降法的变种和普通梯度下降法的区别是每次迭代仅仅用一部分的样本来计算梯度适合于样本数据多的时候。saga线性收敛的随机优化算法的的变重。总结liblinear适用于小数据集而sag和saga适用于大数据集因为速度更快。对于多分类问题只有newton-cg,sag,saga和lbfgs能够处理多项损失而liblinear受限于一对剩余(OvR)。啥意思就是用liblinear的时候如果是多分类问题得先把一种类别作为一个类别剩余的所有类别作为另外一个类别。一次类推遍历所有类别进行分类。newton-cg,sag和lbfgs这三种优化算法时都需要损失函数的一阶或者二阶连续导数因此不能用于没有连续导数的L1正则化只能用于L2正则化。而liblinear和saga通吃L1正则化和L2正则化。同时sag每次仅仅使用了部分样本进行梯度迭代所以当样本量少的时候不要选择它而如果样本量非常大比如大于10万sag是第一选择。但是sag不能用于L1正则化所以当你有大量的样本又需要L1正则化的话就要自己做取舍了。要么通过对样本采样来降低样本量要么回到L2正则化。从上面的描述大家可能觉得既然newton-cg, lbfgs和sag这么多限制如果不是大样本我们选择liblinear不就行了嘛错因为liblinear也有自己的弱点我们知道逻辑回归有二元逻辑回归和多元逻辑回归。对于多元逻辑回归常见的有one-vs-rest(OvR)和many-vs-many(MvM)两种。而MvM一般比OvR分类相对准确一些。郁闷的是liblinear只支持OvR不支持MvM这样如果我们需要相对精确的多元逻辑回归时就不能选择liblinear了。也意味着如果我们需要相对精确的多元逻辑回归不能使用L1正则化了。max_iter算法收敛最大迭代次数int类型默认为10。仅在正则化优化算法为newton-cg, sag和lbfgs才有用算法收敛的最大迭代次数。multi_class分类方式选择参数str类型可选参数为ovr和multinomial默认为ovr。ovr即前面提到的one-vs-rest(OvR)而multinomial即前面提到的many-vs-many(MvM)。如果是二元逻辑回归ovr和multinomial并没有任何区别区别主要在多元逻辑回归上。OvR和MvM有什么不同OvR的思想很简单无论你是多少元逻辑回归都可以看做二元逻辑回归。具体做法是对于第K类的分类决策我们把所有第K类的样本作为正例除了第K类样本以外的所有样本都作为负例然后在上面做二元逻辑回归得到第K类的分类模型。其他类的分类模型获得以此类推。而MvM则相对复杂这里举MvM的特例one-vs-one(OvO)作讲解。如果模型有T类我们每次在所有的T类样本里面选择两类样本出来不妨记为T1类和T2类把所有的输出为T1和T2的样本放在一起把T1作为正例T2作为负例进行二元逻辑回归得到模型参数。我们一共需要T(T-1)/2次分类。可以看出OvR相对简单但分类效果相对略差这里指大多数样本分布情况某些样本分布下OvR可能更好。而MvM分类相对精确但是分类速度没有OvR快。如果选择了ovr则4种损失函数的优化方法liblinearnewton-cg,lbfgs和sag都可以选择。但是如果选择了multinomial,则只能选择newton-cg, lbfgs和sag了。verbose日志冗长度int类型。默认为0。就是不输出训练过程1的时候偶尔输出结果大于1对于每个子模型都输出。warm_start热启动参数bool类型。默认为False。如果为True则下一次训练是以追加树的形式进行重新使用上一次的调用作为初始化。n_jobs并行数。int类型默认为1。1的时候用CPU的一个内核运行程序2的时候用CPU的2个内核运行程序。为-1的时候用所有CPU的内核运行程序。还有其他参数例子fromsklearn.datasetsimportload_irisfromsklearn.linear_modelimportLogisticRegressionX,yload_iris(return_X_yTrue)clfLogisticRegression(random_state0).fit(X,y)clf.predict(X[:2,:])array([0,0])clf.predict_proba(X[:2,:])array([[9.8...e-01,1.8...e-02,1.4...e-08],[9.7...e-01,2.8...e-02,...e-08]])clf.score(X,y)0.97...Logistic 回归算法实现理论和代码在博客《机器学习实战》学习笔记五Logistic 回归

相关新闻

PHP:数组函数(1)

PHP:数组函数(1)

数组函数: 1.需求: 1)获取数组中的value. function getval($arr){foreach($arr as $key>$val){$row[]$val;}return $row; }** <?php $arrarray(item1>linux,item2>php,item3>java,item4>mysql,item5>jquery );// 数组遍历foreach($arr as $key>$val){…

2026/7/28 18:08:04阅读更多 →
NBM7100A与PIC18F56K42实现超低功耗物联网设备设计

NBM7100A与PIC18F56K42实现超低功耗物联网设备设计

1. 项目背景与核心挑战在物联网设备和便携式电子产品的设计中&#xff0c;如何最大化初级电池&#xff08;不可充电电池&#xff09;的使用寿命一直是个关键难题。我最近在一个野外环境监测项目中使用NBM7100A电源管理芯片搭配PIC18F56K42微控制器&#xff0c;成功将CR2032纽扣…

2026/7/28 18:08:04阅读更多 →
关于MySQL多表关联时过滤条件的位置

关于MySQL多表关联时过滤条件的位置

简单的一个Demo说明下问题表A和表B关联查询&#xff0c;以project_id4为过滤条件&#xff0c;查询结果返回表A中的ID&#xff0c;name&#xff0c;表B中的project_id,如果表B中没有和表A匹配的记录则a.project_id返回null&#xff0c;于是第一次我就写出了这样的SQLSELECTt.id,…

2026/7/28 18:08:04阅读更多 →
Spring AI Alibaba 的 PoiDocumentReader 把 docx 灌进向量库,跑起来直接抛异常

Spring AI Alibaba 的 PoiDocumentReader 把 docx 灌进向量库,跑起来直接抛异常

— 一次 POI 版本不一致导致的 SPI 加载异常排查记录 — 一、问题现场 今天用 Spring AI Alibaba 的 PoiDocumentReader 把 docx 灌进向量库&#xff0c;跑起来直接抛异常&#xff1a; Your InputStream was neither an OLE2 stream, nor an OOXML stream or you havent prov…

2026/7/29 3:50:34阅读更多 →
汽车尾灯模组设计全解析:从LED驱动到车规MCU的嵌入式系统实现

汽车尾灯模组设计全解析:从LED驱动到车规MCU的嵌入式系统实现

1. 从“亮起来”到“会说话”&#xff1a;现代汽车尾灯模组的深度拆解最近在折腾一个车载电子的小项目&#xff0c;跟几个搞硬件的朋友聊起来&#xff0c;发现大家对一个看似简单的部件——汽车尾灯——背后的技术复杂度都低估了。很多人觉得&#xff0c;尾灯嘛&#xff0c;不就…

2026/7/29 3:50:34阅读更多 →
CAN总线技术详解:从核心原理到汽车与工业自动化实战应用

CAN总线技术详解:从核心原理到汽车与工业自动化实战应用

1. 项目概述&#xff1a;从“汽车神经”到工业脉络如果你拆开过一辆现代汽车的控制单元&#xff0c;或者打开过一台工业机器人的控制柜&#xff0c;大概率会看到几根拧在一起的双绞线&#xff0c;连接着大大小小的黑色盒子。这些不起眼的线缆&#xff0c;就是CAN总线的物理载体…

2026/7/29 3:50:34阅读更多 →
专业级AI生成原型工具选购指南2026全场景测评与选型建议

专业级AI生成原型工具选购指南2026全场景测评与选型建议

最近半年&#xff0c;我带着团队把市面上主流的AI原型生成工具都撸了一遍&#xff0c;从Figma、MasterGo到Axure、墨刀&#xff0c;再到UIzard和Framer AI&#xff0c;踩过坑也捡过宝。这篇文章我就从自己的实际体验出发&#xff0c;聊聊这些工具到底怎么选、怎么避坑&#xff…

2026/7/29 3:50:34阅读更多 →
算力电力协同优化:多目标区间-随机优化方法解析

算力电力协同优化:多目标区间-随机优化方法解析

1. 项目背景与核心挑战在数字化转型浪潮下&#xff0c;算力与电力资源的协同优化已成为关键基础设施规划的前沿课题。我们团队近期完成的"算力-电力联合市场"研究&#xff0c;针对数据中心与配电网的集成规划问题&#xff0c;提出了一套创新性的多目标区间-随机优化方…

2026/7/29 3:50:34阅读更多 →
UE4/UE5 TaskGraph源码解析:高性能多线程任务调度与优化实践

UE4/UE5 TaskGraph源码解析:高性能多线程任务调度与优化实践

1. 项目概述&#xff1a;为什么需要深入理解TaskGraph&#xff1f;在UE4&#xff08;以及现在的UE5&#xff09;里做性能优化&#xff0c;尤其是想让游戏跑得更顺滑、帧率更稳定&#xff0c;多线程是绕不开的话题。很多开发者刚开始接触UE4的多线程&#xff0c;可能都是从FRunn…

2026/7/29 3:48:34阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

&#x1f539; 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具&#xff0c;凭借本地离线运行、可视化图形操作和任务自动化三大核心特性&#xff0c;赢得了众多用户的青睐。与普通在线对话AI工具不同&#xff0c;它属于能够直接操控本机软硬件的智能数字员工…

2026/7/28 4:06:39阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接&#xff0c;是用激光束对阀座壳体&#xff08;通常为不锈钢或铝合金&#xff09;进行密封焊接&#xff0c;使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/28 2:08:06阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX&#xff1a;三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/28 1:38:28阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停&#xff1f;用 interrupt 给它设个“关卡“&#xff01; 在构建复杂的 Agent 系统时&#xff0c;我们经常会遇到这样的场景&#xff1a;Agent 正在执行一个多步骤的任务&#xff0c;比如“下单购买商品”&#xff0c;但执行到一半时&#xff0c;我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日&#xff0c;国际专注开放式技术研发的声学品牌Nank南卡&#xff0c;正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手&#xff1f;而且是选择曾舜晞&#xff1f;让我们一起来探索一下&#xff01;比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时&#xff0c;发现推理速度只有可怜的 1-2 FPS&#xff0c;而别人的演示视频却能跑到 30 FPS 以上&#xff0c;那么问题很可能不在模型本身&#xff0c;而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后&#xff0c;会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一&#xff1a;为什么你需要了解 Coze 和 Dify&#xff1f;如果你对 AI 应用开发感兴趣&#xff0c;但一看到“大模型”、“智能体”、“工作流”这些词就头疼&#xff0c;觉得门槛太高&#xff0c;那这篇文章就是为你准备的。很多开发者&#xff0c;包括我自己&#…

2026/7/28 3:17:03阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会&#xff1a;配图一直是个让人头疼的问题。2026年&#xff0c;AI生图工具已经非常成熟了&#xff0c;但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1&#xff1a;速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →