用Python实现K-近邻算法

希尔瓦娜斯发布于 2018-04-26 09:45查看:1786

写在前面

额、、、最近开始学习机器学习嘛，网上找到一本关于机器学习的书籍，名字叫做《机器学习实战》。很巧的是，这本书里的算法是用Python语言实现的，刚好之前我学过一些Python基础知识，所以这本书对于我来说，无疑是雪中送炭啊。接下来，我还是给大家讲讲实际的东西吧。

什么是K-近邻算法？

简单的说，K-近邻算法就是采用测量不同特征值之间的距离方法来进行分类。它的工作原理是：存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系，输入没有标签的新数据之后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取出样本集中特征最相似数据的分类标签。一般来说，我们只选择样本数据集中前k个最相似的数据，这就是K-近邻算法名称的由来。

提问：亲，你造K-近邻算法是属于监督学习还是无监督学习呢？

使用Python导入数据

从K-近邻算法的工作原理中我们可以看出，要想实施这个算法来进行数据分类，我们手头上得需要样本数据，没有样本数据怎么建立分类函数呢。所以，我们第一步就是导入样本数据集合。

建立名为kNN.py的模块，写入代码：

代码中，我们需要导入Python的两个模块：科学计算包NumPy和运算符模块。NumPy函数库是Python开发环境的一个独立模块，大多数Python版本里没有默认安装NumPy函数库，因此这里我们需要单独安装这个模块。

实现K-近邻算法

K-近邻算法的具体思想如下：

（1）计算已知类别数据集中的点与当前点之间的距离

（2）按照距离递增次序排序

（3）选取与当前点距离最小的k个点

（4）确定前k个点所在类别的出现频率

（5）返回前k个点中出现频率最高的类别作为当前点的预测分类

Python语言实现K-近邻算法的代码如下：

运算结果如下：

输出结果是B：说明我们新的数据（[0,0]）是属于B类。

代码详解

相信有很多朋友们对上面这个代码有很多不理解的地方，接下来，我重点讲解几个此函数的关键点，以方便读者们和我自己回顾一下这个算法代码。

classify函数的参数：

inX：用于分类的输入向量
dataSet：训练样本集合
labels：标签向量
k：K-近邻算法中的k

shape：是array的属性，描述一个多维数组的维度

tile（inX, (dataSetSize,1)）：把inX二维数组化，dataSetSize表示生成数组后的行数，1表示列的倍数。整个这一行代码表示前一个二维数组矩阵的每一个元素减去后一个数组对应的元素值，这样就实现了矩阵之间的减法，简单方便得不让你佩服不行！

axis=1：参数等于1的时候，表示矩阵中行之间的数的求和，等于0的时候表示列之间数的求和。

argsort()：对一个数组进行非降序排序

classCount.get(numOflabel,0) + 1：这一行代码不得不说的确很精美啊。get()：该方法是访问字典项的方法，即访问下标键为numOflabel的项，如果没有这一项，那么初始值为0。然后把这一项的值加1。所以Python中实现这样的操作就只需要一行代码，实在是很简洁高效。

后话

K-近邻算法（KNN）原理以及代码实现差不多就这样了，接下来的任务就是更加熟悉它，争取达到裸敲的地步。

查看评分情况

全部评分

此主贴暂时没有点赞评分

总计：赞0次

回复分享

版主推荐

房屋出租管理系统小程序版（附项目源码）视频教程

人脸识别门禁系统（附vue+springboot项目源码）视频教程

房屋出租管理系统（附vue+springboot项目源码）视频教程

健身房会员管理系统（附springmvc项目源码）视频教程

车牌识别停车场管理系统（附SSM项目源代码）视频教程

上一篇：使用Python的Supervisor来管理进程
下一篇：善用python的else子句

精品在线课程【一线专家讲授+24小时内答疑+永久免费观看+市场1/10价格】

[换一换]

共有0条评论

本论坛发帖,请先登录

发布新贴

版主招版主啦

IT宅男
mr jack
Mr ken
Mright
cappuccino
YUI
课课家运营团队
课课家技术团队1
酸酸~甜甜

课程推荐

[换一换]

手把手教你掌握区块链技术视频教程: 9201人学习

JavaSE 线程编程精讲【凯哥学堂】视频教程: 20165人学习

Python Web开发练手项目V1.0学生管理系统视频教程: 10726人学习

Python基础视频教程: 10479人学习

楼主关注

发布新贴

选择版块:
标题:
内容
验证码:

编辑帖子

标题:
内容
<h1 style="border: 0px; margin: 0px 0px 20px; padding: 0px; font-size: 26px; font-variant-numeric: normal; font-variant-east-asian: normal; font-stretch: normal; line-height: 40px; font-family: "Microsoft YaHei", "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; color: rgb(46, 46, 46); white-space: normal; background-color: rgb(255, 255, 255);">写在前面</h1><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">额、、、最近开始学习机器学习嘛，网上找到一本关于机器学习的书籍，名字叫做《机器学习实战》。很巧的是，这本书里的算法是用Python语言实现的，刚好之前我学过一些Python基础知识，所以这本书对于我来说，无疑是雪中送炭啊。接下来，我还是给大家讲讲实际的东西吧。<h1 style="border: 0px; margin: 0px 0px 20px; padding: 0px; font-size: 26px; font-variant-numeric: normal; font-variant-east-asian: normal; font-stretch: normal; line-height: 40px; font-family: "Microsoft YaHei", "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; color: rgb(46, 46, 46); white-space: normal; background-color: rgb(255, 255, 255);">什么是K-近邻算法？</h1><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">简单的说，K-近邻算法就是采用测量不同特征值之间的距离方法来进行分类。它的工作原理是：存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系，输入没有标签的新数据之后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取出样本集中特征最相似数据的分类标签。一般来说，我们只选择样本数据集中前k个最相似的数据，这就是K-近邻算法名称的由来。<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">提问：亲，你造K-近邻算法是属于监督学习还是无监督学习呢？<h1 style="border: 0px; margin: 0px 0px 20px; padding: 0px; font-size: 26px; font-variant-numeric: normal; font-variant-east-asian: normal; font-stretch: normal; line-height: 40px; font-family: "Microsoft YaHei", "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; color: rgb(46, 46, 46); white-space: normal; background-color: rgb(255, 255, 255);">使用Python导入数据</h1><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">从K-近邻算法的工作原理中我们可以看出，要想实施这个算法来进行数据分类，我们手头上得需要样本数据，没有样本数据怎么建立分类函数呢。所以，我们第一步就是导入样本数据集合。<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">建立名为kNN.py的模块，写入代码：<img src="/Public/forum/ueditor/image/20180426/1524707098609105.png" title="1524707098609105.png" alt="image.png"/>代码中，我们需要导入Python的两个模块：科学计算包NumPy和运算符模块。NumPy函数库是Python开发环境的一个独立模块，大多数Python版本里没有默认安装NumPy函数库，因此这里我们需要单独安装这个模块。 <h1 style="border: 0px; margin: 0px 0px 20px; padding: 0px; font-size: 26px; font-variant-numeric: normal; font-variant-east-asian: normal; font-stretch: normal; line-height: 40px; font-family: "Microsoft YaHei", "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; color: rgb(46, 46, 46); white-space: normal; background-color: rgb(255, 255, 255);">实现K-近邻算法</h1><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">K-近邻算法的具体思想如下：<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">（1）计算已知类别数据集中的点与当前点之间的距离<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">（2）按照距离递增次序排序<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">（3）选取与当前点距离最小的k个点<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">（4）确定前k个点所在类别的出现频率<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">（5）返回前k个点中出现频率最高的类别作为当前点的预测分类<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">Python语言实现K-近邻算法的代码如下：<img src="/Public/forum/ueditor/image/20180426/1524707121995199.png" title="1524707121995199.png" alt="image.png"/>运算结果如下： <img src="/Public/forum/ueditor/image/20180426/1524707135257215.png" title="1524707135257215.png" alt="image.png"/><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">输出结果是B：说明我们新的数据（[0,0]）是属于B类。<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">代码详解<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">相信有很多朋友们对上面这个代码有很多不理解的地方，接下来，我重点讲解几个此函数的关键点，以方便读者们和我自己回顾一下这个算法代码。<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">classify函数的参数：<ul style="border: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; list-style-position: outside; list-style-image: initial; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);" class=" list-paddingleft-2"><li>inX：用于分类的输入向量</li><li>dataSet：训练样本集合</li><li>labels：标签向量</li><li>k：K-近邻算法中的k</li></ul><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">shape：是array的属性，描述一个多维数组的维度<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">tile（inX, (dataSetSize,1)）：把inX二维数组化，dataSetSize表示生成数组后的行数，1表示列的倍数。整个这一行代码表示前一个二维数组矩阵的每一个元素减去后一个数组对应的元素值，这样就实现了矩阵之间的减法，简单方便得不让你佩服不行！<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">axis=1：参数等于1的时候，表示矩阵中行之间的数的求和，等于0的时候表示列之间数的求和。<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">argsort()：对一个数组进行非降序排序<p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">classCount.get(numOflabel,0) + 1：这一行代码不得不说的确很精美啊。get()：该方法是访问字典项的方法，即访问下标键为numOflabel的项，如果没有这一项，那么初始值为0。然后把这一项的值加1。所以Python中实现这样的操作就只需要一行代码，实在是很简洁高效。<h1 style="border: 0px; margin: 0px 0px 20px; padding: 0px; font-size: 26px; font-variant-numeric: normal; font-variant-east-asian: normal; font-stretch: normal; line-height: 40px; font-family: "Microsoft YaHei", "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; color: rgb(46, 46, 46); white-space: normal; background-color: rgb(255, 255, 255);">后话</h1><p style="border: 0px; margin-top: 0px; margin-bottom: 20px; padding: 0px; font-size: 15px; color: rgb(46, 46, 46); font-family: "Microsoft YaHei", 宋体, "Myriad Pro", Lato, "Helvetica Neue", Helvetica, Arial, sans-serif; white-space: normal; background-color: rgb(255, 255, 255);">K-近邻算法（KNN）原理以及代码实现差不多就这样了，接下来的任务就是更加熟悉它，争取达到裸敲的地步。
选择版块:

关注微信公众号，可下载APP应用。

用Python实现K-近邻算法

写在前面

什么是K-近邻算法？

使用Python导入数据

实现K-近邻算法

后话

版主推荐

精品在线课程【一线专家讲授+24小时内答疑+永久免费观看+市场1/10价格】

共有0条评论

明星会员

课程推荐

楼主关注

版主推荐

热门贴子

发布新贴

编辑帖子

移动帖子x

粤ICP备13047178号粤公网安备44010602001432号

广州挪贤计算机科技有限公司版权所有

Copyright @ 2013-2025 KokoJia.com Inc. All Rights Reserved.

关注微信公众号，可下载APP应用。

用Python实现K-近邻算法

写在前面

什么是K-近邻算法？

使用Python导入数据

实现K-近邻算法

后话

版主推荐

精品在线课程【一线专家讲授+24小时内答疑+永久免费观看+市场1/10价格】

共有0条评论

明星会员

课程推荐

楼主关注

版主推荐

热门贴子

发布新贴

编辑帖子

移动帖子x

粤ICP备13047178号 粤公网安备44010602001432号

广州挪贤计算机科技有限公司 版权所有

Copyright @ 2013-2025 KokoJia.com Inc. All Rights Reserved.

粤ICP备13047178号粤公网安备44010602001432号

广州挪贤计算机科技有限公司版权所有