k近邻分类算法
第2章k-近邻算法(kNN)
引言
本介绍kNN算法的基本理论以及如何使用距离测量的方法分类物品。其次,将使用python从文本文件中导入并解析数据,然后,当存在许多数据来源时,如何避免计算距离时可能碰到的一些常见的错识。
k-近邻算法概述
k-近邻(k Nearest Neighbors)算法采用测量不同特征之间的距离方法进行分类。它的工作原理是:存在一个样本数据集合,并且样本集中每个数据都存在标签,即我们知道样本每一数据与所属分类的对应关系。输入没有标签的新数据后,将新数据的每个特征与样本集中数据对应的特征进行比较,然后算法提取样本集中特征最相似数据的分类标签。一般来说,我们只选择样本数据集中前k个最相似的数据,这就是k-近邻算法中k的出处,通常k是不大于20的整数。最后,选择k个最相似数据中出现次数最多的分类,作为新数据的分类。
k-近邻算法的优点是精度高,对异常值不敏感,无数据输入假定;缺点是计算复杂度高、空间复杂度高。适用于数值和型数据。
首先,创建名为kNN.py的python模块,然后添加下面代码:
from numpy import *#引入科学计算包import operator #经典python函数库。运算符模块。
#创建数据集def createDataSet():??? group=array([[1.0,1.1],[1.0,1.0],[0,0],[0,0.1]])??? labels=[A,A,B,B]??? return group,labels
createDataSet()
注意:要将kNN.py文件放到Python27文件夹下,否则提示找不到文件。
2.2.2 实施kNN算法
使用k-近邻算法将每组数据划分到某个类中,其伪代码如下:
对未知类别属性的数据集中的每个点依次执行以下操作:
计算已知类别数据集中的点与当前点之间的距离;
按照距离递增交序排序;
选取与当前点距离最小的k个点;
确定前k个点所在类别的出现频率;
返回前k个点出现频率最高的类别作为当前点的预测分类。
例如,点(0, 0)与(1, 2)之间的距离计算为:
python函数classify( )程序如下所示:
#算法核心#inX:用于分类的输入向量。即将对其进行分类。#dataSet:训练样本集#labels:标签向量def classfy0(inX,dataSet,labels,k):??? #距离计算
#得到数组的行数。即知道有几个训练数据??? dataSetSize =dataSet.shape[0]??? diffMat???? =tile(inX,(dataSetSize,1))-dataSet #将inX扩展为4行2列的向量,两个矩阵相减
sqDiffMat?? =diffMat**2 #平方
sqDistances =sqDiffMat.sum(axis=1) #asis=1是按行相加
distances?? =sqDistances**0.5 #开方
sortedDistIndicies=distances.argsort() #升序排列??? #选择距离最小的k个点。??? classCount={}??? for i in range(k):??????? voteIlabel=labels[sortedDistIndicies[i]]??????? classCount[voteIlabel]=classCount.get(voteIlabel,0)+1??? #排序??? sortedClassCount=sorted(classCount.iteritems(),key=operator.itemgetter(1),reverse=True)??? return sortedClassCount[0][0]
测试:kNN .classify0([0,0],group, labels,3)
2.2示例:使用k-近邻算法改进约会网站的配对结果
在约会网站上使用k-近邻算法的步骤:
1.收集数据:提供文本文件。
准备数据:使用python解析文本文件。
分析数据:使用Matplotlib画二维扩散图。
训练算法:此步骤不适用于k-近邻算法。
测试算法:使用部分数据作为测试样本。测试样本与非测试样本的区别在于:测试样本是已经完成分类的数据,如果预没分类与实际类别不同,则标记为一个error.
使用算法:产生简单的命令行程序,然后可以输入一些特征数据以判断对方是否为自己喜欢的类型。
将数据存放到文本文件,每一个样本数据占据一行。首先,必须将特处理数据改变为分类器可以接受的格式。在kNN.py中创建file2matrix的函数,以此来处理输入格式
您可能关注的文档
- 青创会发布会资料.ppt
- 人教版初中语文必背古诗词资料.doc
- 人教版初中语文必背文言文资料.doc
- ippbx拓扑图模板.ppt
- 青春不叛逆主题班会课件资料.ppt
- 人教版初中语文古诗词赏析总复习(学生卷)资料.doc
- 青春不叛逆资料.ppt
- 人教版初中语文汇总4:一词多义资料.doc
- 青春不言败资料.ppt
- 人教版初中语文课内外全部古诗词分册汇编资料.doc
- 2025年全国演出经纪人员资格认定考试试卷带答案(研优卷).docx
- 2025年全国演出经纪人员资格认定考试试卷完整版.docx
- 2025年全国演出经纪人员资格认定考试试题库及完整答案.docx
- 2025年全国演出经纪人员资格认定考试试卷完美版.docx
- 2025年全国演出经纪人员资格认定考试试卷含答案(实用).docx
- 2025年全国演出经纪人员资格认定考试试卷及答案(各地真题).docx
- 2025年下半年内江市部分事业单位公开考试招聘工作人员(240人)备考题库附答案.docx
- 2025年全国演出经纪人员资格认定考试试卷及答案1套.docx
- 2025年下半年四川成都市郫都区面向社会引进公共类事业单位人员2人备考题库最新.docx
- 2025年下半年内江市部分事业单位公开考试招聘工作人员(240人)备考题库附答案.docx
最近下载
- 深度解析(2026)《GBT 6398-2017金属材料 疲劳试验 疲劳裂纹扩展方法》(2026年)深度解析.pptx VIP
- 2025浙江绍兴越城区初升高自主招生数学试卷试题(含答案详解).docx VIP
- 大数据在桥梁结构健康监测中的应用研究.docx VIP
- catti二级笔译日语真题及答案2025.doc VIP
- 电工类本科国网考试注意事项及复习方法 .pdf VIP
- EHS100系列电液伺服使用说明书V1.5.pdf VIP
- 2024年国网北京公司考试真题.docx VIP
- 2025年甘肃省嘉峪关市中考英语试卷.docx
- 补填入党志愿书的参考格式【最新精选】.doc VIP
- JJF(蒙) 119-2025 烷基汞分析仪校准规范.docx VIP
原创力文档

文档评论(0)