惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Microsoft Azure Blog
Microsoft Azure Blog
WordPress大学
WordPress大学
Google DeepMind News
Google DeepMind News
美团技术团队
大猫的无限游戏
大猫的无限游戏
H
Help Net Security
小众软件
小众软件
aimingoo的专栏
aimingoo的专栏
博客园 - 聂微东
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
M
MIT News - Artificial intelligence
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Microsoft Security Blog
Microsoft Security Blog
F
Fortinet All Blogs
A
About on SuperTechFans
Recent Announcements
Recent Announcements
D
Docker
Vercel News
Vercel News
Engineering at Meta
Engineering at Meta
腾讯CDC
Martin Fowler
Martin Fowler
阮一峰的网络日志
阮一峰的网络日志

晚花行乐

马克卡尼在2026年达沃斯论坛上的讲话(阅读材料) | 晚花行乐 鸡娃如何用力才是恰到好处 | 晚花行乐 读万卷书,行万里路的辩证关系 | 晚花行乐 反对培训机构掐尖招生 | 晚花行乐 小泽和建国会谈最后10分钟全文(阅读材料) | 晚花行乐 来看看 DeepSeek 怎么鸡娃 | 晚花行乐 谈谈基本功 | 晚花行乐 惠普 ProDesk SFF PC 各系列参数对比 | 晚花行乐 解决瘦客户机上安装 Debian 12 启动失败问题 | 晚花行乐 意拾喻言:老外写的文言文 | 晚花行乐 笠翁对韵中的典故(十三元) | 晚花行乐 谈谈中考取消四小门 | 晚花行乐 亚马逊云科技产品免费试用攻略(3) - 对象存储服务 | 晚花行乐 在 Windows 10 LTSC 版本上安装 WSL2 | 晚花行乐 Debian 12 的常用配置项 | 晚花行乐 在 Debian 12 上安装 Nvidia 显卡驱动程序 | 晚花行乐 解决 Debian 12 关机失败问题 | 晚花行乐 解决 VS Code 自动更新版本后卡在连接界面 | 晚花行乐 观看巴黎奥运会有感 | 晚花行乐 在 Windows10 上安装惠普旧打印机驱动程序 | 晚花行乐 欢迎关注公众号:晚花行乐 | 晚花行乐 如何编写拼写检查器 | 晚花行乐 亚马逊云科技产品免费试用攻略(2) - 云服务器 | 晚花行乐 Pandas 中 axis 参数的理解(附实例) | 晚花行乐 我打算命个名,叫什么什么 Manager | 晚花行乐 上海武康路历史建筑一览 | 晚花行乐 Python 实现简单的数学表达式解析并处理 | 晚花行乐 观看马拉松的感悟 | 晚花行乐 Python 保存 Cookies 到文件并再次读取 | 晚花行乐 如何为 Hugo 静态网站添加评论功能 | 晚花行乐
Scikit-learn 学习笔记(3)监督学习的例子 | 晚花行乐
2022-08-04 · via 晚花行乐

这个系列是我通过阅读 Scikit-learn 的文档,结合自己的理解和掌握的知识,重新把文档描述出来。希望能加深自己的理解,希望能帮到有需要的人。

学习材料:https://scikit-learn.org/stable/tutorial/statistical_inference/supervised_learning.html

监督学习的概念

这篇文章 中介绍了监督学习的概念。简单的说,就是用一批带有已知标签的数据集,来预测没有标签的数据的标签。

监督学习要解决的问题

监督学习中,输入是观测样本矩阵 XX 的一个维度是特征,另一个维度是样本,(也就是 数据集,参看这篇),输出则是一个一维的的向量 y,叫做 “目标 target” 或者 “标签 label”,这个向量的维度和样本的维度一样。对于每一次的观测样本,输出一个标签,所以一般来说,输出的标签向量的长度和样本个数相同。

分类(classification):如果一个预测任务是将数据集划分为有限多个标签,(比如 这篇 中的iris数据,预测花的种类),换句话说,是给每个数据集打一个标签,命一个名,那么这个任务就称为分类任务。

分类的标签是离散的变量,任务是给测试样本“定性”; 如果一个要预测的对象是连续的变量,任务是给测试样本“定量”,那么该任务就称为回归(regression)。

分类问题的例子

鸢尾花数据集 中,来自三种鸢尾花,分别为 Setosa、Versicolour、Virginica。 所以这套训练数据中会有三种标签,从下面的代码可以看出来:

 import numpy as np
 from sklearn import datasets

 iris_X, iris_y = datasets.load_iris(return_X_y=True)
 print(np.unique(iris_y))

结果是:

[0 1 2]

这里用三个数字表示数据的标签。

K-最近邻算法

最简单的监督学习分类器是 K-最近邻算法。

scikit-learn 库里的每一个监督估计器都有一个 .fit(X, y) 方法函数和一个 predict(X) 方法函数。.fit(X, y) 用于拟合数据,predict(X) 用于预测 y

scikit-learn 库,y 向量的成员是整数或者字符串。

各位读后有什么想法,请在下方留言吧!如果对本文有疑问或者寻求合作,欢迎 联系邮箱邮箱已到剪贴板

精彩评论