k近邻分类算法..doc

  1. 1、本文档共10页,可阅读全部内容。
  2. 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
  3. 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  4. 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
k近邻分类算法.

第2章k-近邻算法(kNN) 引言 本介绍kNN算法的基本理论以及如何使用距离测量的方法分类物品。其次,将使用python从文本文件中导入并解析数据,然后,当存在许多数据来源时,如何避免计算距离时可能碰到的一些常见的错识。 k-近邻算法概述 k-近邻(k Nearest Neighbors)算法采用测量不同特征之间的距离方法进行分类。它的工作原理是:存在一个样本数据集合,并且样本集中每个数据都存在标签,即我们知道样本每一数据与所属分类的对应关系。输入没有标签的新数据后,将新数据的每个特征与样本集中数据对应的特征进行比较,然后算法提取样本集中特征最相似数据的分类标签。一般来说,我们只选择样本数据集中前k个最相似的数据,这就是k-近邻算法中k的出处,通常k是不大于20的整数。最后,选择k个最相似数据中出现次数最多的分类,作为新数据的分类。 k-近邻算法的优点是精度高,对异常值不敏感,无数据输入假定;缺点是计算复杂度高、空间复杂度高。适用于数值和型数据。 首先,创建名为kNN.py的python模块,然后添加下面代码: from numpy import *#引入科学计算包 import operator #经典python函数库。运算符模块。 #创建数据集 def createDataSet(): ??? group=array([[1.0,1.1],[1.0,1.0],[0,0],[0,0.1]]) ??? labels=[A,A,B,B] ??? return group,labels createDataSet() 注意:要将kNN.py文件放到Python27文件夹下,否则提示找不到文件。 2.2.2 实施kNN算法 使用k-近邻算法将每组数据划分到某个类中,其伪代码如下: 对未知类别属性的数据集中的每个点依次执行以下操作: 计算已知类别数据集中的点与当前点之间的距离; 按照距离递增交序排序; 选取与当前点距离最小的k个点; 确定前k个点所在类别的出现频率; 返回前k个点出现频率最高的类别作为当前点的预测分类。 例如,点(0, 0)与(1, 2)之间的距离计算为: python函数classify( )程序如下所示: #算法核心 #inX:用于分类的输入向量。即将对其进行分类。 #dataSet:训练样本集 #labels:标签向量 def classfy0(inX,dataSet,labels,k): ??? #距离计算 #得到数组的行数。即知道有几个训练数据 ??? dataSetSize =dataSet.shape[0] ??? diffMat???? =tile(inX,(dataSetSize,1))-dataSet #将inX扩展为4行2列的向量,两个矩阵相减 sqDiffMat?? =diffMat**2 #平方 sqDistances =sqDiffMat.sum(axis=1) #asis=1是按行相加 distances?? =sqDistances**0.5 #开方 sortedDistIndicies=distances.argsort() #升序排列 ??? #选择距离最小的k个点。 ??? classCount={} ??? for i in range(k): ??????? voteIlabel=labels[sortedDistIndicies[i]] ??????? classCount[voteIlabel]=classCount.get(voteIlabel,0)+1 ??? #排序 ??? sortedClassCount=sorted(classCount.iteritems(),key=operator.itemgetter(1),reverse=True) ??? return sortedClassCount[0][0] 测试:kNN .classify0([0,0],group, labels,3) 2.2示例:使用k-近邻算法改进约会网站的配对结果 在约会网站上使用k-近邻算法的步骤: 1.收集数据:提供文本文件。 准备数据:使用python解析文本文件。 分析数据:使用Matplotlib画二维扩散图。 训练算法:此步骤不适用于k-近邻算法。 测试算法:使用部分数据作为测试样本。测试样本与非测试样本的区别在于:测试样本是已经完成分类的数据,如果预没分类与实际类别不同,则标记为一个error. 使用算法:产生简单的命令行程序,然后可以输入一些特征数据以判断对方是否为自己喜欢的类型。 将数据存放到文本文件,每一个样本数据占据一行。首先,必须将特处理数据改变为分类器可以接受的格式。在kNN.py中创建file2matrix的函数,以此来处理输入格式

文档评论(0)

kaiss + 关注
实名认证
内容提供者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档