- 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
- 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
山东农业大学学报(自然科学版),2014,45(2):216-222 VOL.45NO.22014
JournalofShandongAgriculturalUniversity(NaturalScienceEdition) doi:10.3969/j.issn.1000-2324.2014.02.011
kNN算法在手机短信客户端分类中的应用研究
1 2 1
王 红 ,张燕平 ,陈功平
1.六安职业技术学院,信息工程系,安徽六安 237158
2.安徽大学,计算机科学与技术学院,安徽合肥 230039
摘 要:研究并实现了kNN算法的手机短信客户端分类系统,从自建的短信语料库中提取到正常短信和垃圾短信两个特
征向量集,通过预处理、降维和去除词频过小的特征项,使特征向量集可最大程度的载有该类短信的特征项。短信语料
n 600
库分成比对库和测试库两部分。研究发现,比对库的短信数量 取 时分类效果最好,过小则降低短信的识别率,过
大则提升分类时间复杂度,近邻数k取25时效果最优。同时研究了当k条短信选取时的概率差在1%~2%时,短信类别
确定时的数量差在5到15之间时,效果最优。遵循保证正常短信的通过率的同时加大垃圾短信识别率的原则,kNN算
n 600 k 25 1.5% 9
法手机短信客户端分类系统的最终参数 取 , 取 ,概率差取 ,数量差取 ,可使得正常短信和垃圾短信识
别率最高达到97.3%和89%。
关键词:短信分类;kNN算法;特征向量集;向量空间模型
中图分类号;TN929.53 文献标识码:A 文章编号:1000-2324(2014)02-0216-07
Research on the Application for kNN Algorithm at SMS Client
Classification
1 2 1
WANGHong ,ZHANGYan-ping ,CHENGong-ping
1.DepartmentofInformationEngineering,Luan VocationTechnologyCollege,Luan237158,China
2.InstituteofComputerScienceandTechnologyofAnhui University,Hefei230039,China
Abstract: This paper studied and realized the SMS clien classification system based on kNN algorithm and extracted two
featurevectorsse ofthenormalandspamSMSfromtheself-buil SMScorpus,andmadethefeaturevectorsse ge thefeature
item of the SMS to the maximum exten through the pretreatment, reducing dimension and removing the smaller frequency
featureitems.Thestudyshowedtha theclassificationeffec wasthebes whennwastook600,theSMSrecognitionratereduced
whennwastoosmall,theclassificationtimecomplexityenhancedwhenntoolarge,theoptimumwasneighbornumberktobe
took25.A themeantime,theoptimu
文档评论(0)