代码实现!教学视频!Python学习者最易上手的机器学习漫游指南
此刻, 你理应已然掌握了线性回归的概念, 随后, 让我们瞧瞧怎样于其中达成它。
准备工作
from
df = pd.(‘.csv’)
df. =
‘X’, ‘Y’
df.head()
可视化
sns.(“”, =1.1)
sns.(“ticks”)
sns.(‘X’,’Y’, data=df)
plt.(‘’)
plt.(‘’)
实现
= .()
= np.(df.X
20:len(df.X)
).(-1, 1)
= np.(df.Y
20:len(df.Y)
).(-1, 1)
testX = np.(df.X).(-1, 1)
testY = np.(df.Y).(-1, 1)
.fit(, )
.score(, )
print(‘: \n’, .coef_)
print(‘: \n’, .)
= .(testX)
逻辑回归
讲解
在有监督分类算法范围里, 逻辑回归属于其中一种, 它对于预测离散变量颇有效力。有一种典型做法, 即以逻辑回归方程去预测事件于0至1这个区间内发生的概率。
头一回学习逻辑回归之际, 觉着它不过是个小众工具, 并未予以相当重视。随后才发觉, 这般想法实在偏差极大了。逻辑回归存有若干潜在概念, 于机器学习的别样算法像神经网络里也被加以运用。请诸位务必牢牢记住这一点, 接着去查看下面的视频以了解更多内容。
现在你已经掌握了逻辑回归的一些概念,让我们在中加以实现。
准备工作
from .
df = pd.(‘df.csv’)
df. =
‘X’, ‘Y’
df.head()
可视化
sns.(“”, =1.1)
sns.(“ticks”)
sns.(‘X’,’Y’, data=df, =True)
plt.(‘’)
plt.(‘’)
实现
= ()
X = (np.(df.X)).(-1, 1)
Y = (np.(df.Y)).ravel()
.fit(X, Y)
.score(X, Y)
print(‘: \n’, .coef_)
print(‘: \n’, .)
先输出‘R² Value: \n’, 再输出, .score(X, Y) 所得到的结果。
决策树
讲解
有监督学习包含决策树这一种, 既能应用于分类也可运用于回归。以我的经验而言, 它们主要被用于分类。模型首先接纳输入的一种情形, 随后顺着树枝朝下走, 依照设计好的条件检验重要变量。根据得出的结果, 抉择是继续朝着左边的子枝行进还是朝着右边的子枝走去, 这般反复。通常在整个过程当中, 最为重要的特征会更靠近树的根部。
变得越来越受欢迎并被任何项目的数据科学家当作一种强分类算法使用的决策树, 特别是在与随机森林算法和其他算法一同运用时, 再一次, 借助下方的视频能更深入地了解它的基础功能。
现在你知道决策树以及它怎样运作了,让我们去中实践一下。
准备工作
from tree
df = pd.(‘.csv’)
df. =
‘X1’, ‘X2’, ‘X3’, ‘X4’, ‘Y’
df.head()
实现
from .
= tree.er(=’gini’)
X = df.
Y = df.
这样的句子结构似乎存在错误呢, 不太能按照你的要求进行有效的改写。请确认一下原句是否准确无误。
.fit(, )
打印(":"换行打印经过测试元素一、测试元素二进行评分的结果)。
可视化
from ..six
from . Image
as pydot
= ()
tree.(, =)
graph = pydot.(.())
Image(graph.())
支持向量机
讲解
一种知名的有监督分类算法, 被称作支持向量机, 也叫SVM, 它借助在不同类别的数据之间生成一条分界线来达成分类, 简单讲, 就是经由计算最优分割平面, 让属于两个不同类的数据点间隔达到最大, 进而获取分类向量。
被默认或者视作线性的一般是分类向量, 然而并非一定得如此。倘若核函数既不是默认的高斯函数, 又不是线性函数, 那么分类向量能够是非线性的形式。关于SVM存在许多可供介绍的内容, 请持续观看指导视频。(在后台回复“代码”这两个字来获取相关资源)
现在你已经了解支持向量机了,让我们在中一起实践一下。
准备工作
from svm
df = pd.(‘.csv’)
df. =
‘X4’, ‘X3’, ‘X1’, ‘X2’, ‘Y’
df = df.drop(
‘X4’, ‘X3’
, 1)
df.head()
实现
from .
= svm.SVC()
X = df.
Y = df.
, testX, , testY = ( X, Y, = 0.3)
.fit(, )
print(‘: \n’, .score(testX, testY))
pred = .(testX)
可视化
sns.(“”, =1.1)
sns.(“ticks”)
plt.(‘X2’)
plt.(‘X1’)
KNN邻近算法
讲解
名为K最邻近分类算法或者被简称为KNN的那一种, 属于专门用以分类的有监督学习算法。此算法一开头会着重去留意不同类别的中心, 接着会去对比样本跟类中心之间的距离(一般运用欧几里得距离方程)。要是一个样本当中的大多数都归属于某一个类别, 那么这个样本整体就都被归属于这个类别。
你已经了解了KNN算法的内在概念,让我们在中实践一下。
准备工作
from .
df = pd.(‘.csv’)
df. =
‘X1’, ‘X2’, ‘X3’, ‘X4’, ‘Y’
df = df.drop(
‘X4’, ‘X3’
, 1)
df.head()
可视化
sns.(“”, =1.1)
sns.(“ticks”)
sns.(‘X1’,’X2', =True, =False, data=df, hue=’Y’)
plt.(‘X2’)
plt.(‘X1’)
实现
from .
= (=5)
X = df.
Y = df.
, testX, , testY = ( X, Y, = 0.3)
.fit(, )
print(‘: \n’, .score(testX, testY))
pred = .(testX)
随机森林
讲解
随机森林属一种流行的、有着监督性质的集成学习算法, 集成所指的是将诸多“弱学习器”予以结合, 进而形成一个强预测器, 于本例里, 每一个通过随机方式生成的决策树皆为一个弱学习器, 把这些决策树放到一起便成为了一个强预测工具——随机森林, 在后台获取相关视频内容, 以此介绍更多有关随机森林背后所含原理。
知道了随机森林的运作原理,到了在中实践的时间了。
准备工作
from . er
df = pd.(‘.csv’)
df. =
‘X1’, ‘X2’, ‘X3’, ‘X4’, ‘Y’
df.head()
实现
from .
= er()
X = df.
Y = df.
, testX, , testY = ( X, Y, = 0.3)
.fit(, )
print(‘: \n’, .score(testX, testY))
pred = .(testX)
K-Means 聚类算法
讲解
有一种流行的无监督学习分类算法, 叫做K-Means算法, 它主要是用来解决聚类问题的。这个算法里, K是用户预先输入的分类数量。该算法先是随机挑选K个点, 接着运用距离算法把剩下的对象进行分组, 最终达成最优聚类。而模型的好坏主要由数据科学家对K值的设定来决定。按照惯例, 可通过后台获取相关视频以了解更多内容。
当前, 我们已然对于K-Means聚类拥有了更多的了解, 并且也清楚地知晓其真正的原理了。接下来, 让我们在其中去切实地实现一下它所具备的算法。
准备工作
from .
df = pd.(‘.csv’)
df. =
‘X1’, ‘X2’, ‘X3’, ‘X4’, ‘Y’
df = df.drop(
‘X4’, ‘X3’
, 1)
df.head()
实现
from .
= (=3)
X = df.
.fit(X)
df
‘Pred’
= .(X)
df.head()
可视化
sns.(“”, =1.1)
sns.(“ticks”)
将'sns'应用, 针对'X1'、'X2', 存在等于真、等于假的情况, 数据采用'df', 色调设定为'Pred'。
PCA主成分分析
讲解
存在这样一种算法, 它被称之为主成分分析也就是 PCA, 其属于一种降维算法类别, 能够为数据科学家达成诸多事项。最为要害的是, 当模型面临成百上千个各异的所需处理特征情形时, 主成分分析能够极为明显地削减模型的计算量。它是一种无需监督对待依据的模型, 然而使用者依旧得针对降维之后的结果展开分析, 以此保证其能够维持原数据集大概 95%的信息包含量。关于主成分分析, 还有诸多要点可以进行申说, 所以敬请必定观看下面播放的视频啦。相关视频获取依照下文提供的方式: (视频资源, 回复 “代码”2 字即可获取相关资源哦)
当下, 咱们知晓了更多的主成分分析, 且认知与它相关的原理,那就让我们于其中展开一番实践吧!
准备工作
from
df = pd.(‘.csv’)
df. =
‘X1’, ‘X2’, ‘X3’, ‘X4’, ‘Y’
df.head()
实现
from
pca = .PCA()
fa = .()
X = df.
Y = df.
train, test = (X, = 0.3)
= pca.(train)
= pca.(test)
pca.
这一份辅导指南, 仅仅是简单地对当下正流行的, 机器学习算法之中的皮毛进行了介绍, 期望它能够在你们逐渐成为机器学习大师的这么一程旅途上有所助益。
原文链接:
