- 0
- 0
- 约7.29千字
- 约 35页
- 2026-09-18 发布于浙江
- 举报
第三章k近邻算法
目录CONTENTS基本概念3.1预测算法3.2距离定义3.3k近邻算法案例3.4
基本概念3.1
基本概念俗话说得好,“物以类聚,人以群分”,判别一个人的品质特征,常常可以从他的朋友入手,所谓观其友,而知其人。K近邻算法就是和此理论类似的一种简单的机器学习算法。要确定一个样本的类别,可以计算它与所有训练样本的距离,然后找出和该样本最接近的k个样本,统计这些样本的类别进行投票,票数最多的那个类就是分类结果。因为直接比较待预测样本和训练样本的距离,kNN算法也被称为基于实例的算法。下面我们举一个简单的例子来进行说明。如图3-1所示,给出两个不同类别的样本数据,其中A类用方框表示,B类用三角形表示。图中心的圆形样本为需要进行判断的样本。图3-1
基本概念当K=3时,选定距离需判断样本最近的3个目标,即实线圆圈内的范围。此时A类样本有1个,B类样本有2个,所以判断样本属于B类。当K=5时,选定距离判断样本最近的5个目标,即虚线圈内的范围。此时A类样本有3个,B类样本有2个,所以判断样本属于A类。于此我们看到,当无法判定当前待分类点是从属于已知分类中的哪一类时,我们可以依据统计学的理论看它所处的位置特征,衡量它周围邻居的权重,而把它归为(或分配)到权重更大的那一类。这就是K近邻算法的核心思想。KNN方法虽然从原理上也依赖于极限定理,但在类别决策时,只与极少量的相邻样本
原创力文档

文档评论(0)