- 1
- 0
- 约2.87千字
- 约 19页
- 2018-07-30 发布于江苏
- 举报
基于特征域词频的邮件过滤方法的研究3
基于特征域词频的邮件过滤方法的研究 山东经济学院 计算机 刘慧 摘 要: 本文提出了根据邮件特征域信息和特征词频进行垃圾邮件过滤的新方法。介绍在该方法中的文本特征选取、特征词典构造以及基于TF的权值计算等相关技术,以及改进的文本相似度计算概率模型。实验表明该方法在邮件过滤的查全率、查准率等几个性能评价指标上,比传统的Rocchio方法有了明显改善。 目前垃圾邮件的泛滥已给有限的网络带宽及用户宝贵的时间和精力造成了极大的浪费。据统计,2005年垃圾邮件给全球的生产力造成的损失及其他费用达到500亿 美元。中国互联网 络信息中心(CNNIC) 的报告也表明,上 网用户平均收到的 垃圾邮件已占到邮件 总数的57.7%。 定义1:有一些词在邮件中被使用时,被不同的作者认为具有更丰富的主题或内容表现力,经常在一些特定的域中出现,这样的词称作特征词(Character Term),相应的域被称为特征域(Character Field)。 类间相关的评估函数,考虑词条t(Token)在已得到的切分文档集中的出现情况。规定词条t和类别c共现的次数为A,t在非c类别的文档中出现的次数为B,c类别中不包括t的文档数为C,非c类别中不包含t的文档数记为D,语料集合中的所有文档数记为N。基于上面的假设,可以给出评估函数的定义式: x2(t,c)综合比较了词条对某一个类别的贡献和对其余类别的贡献。
原创力文档

文档评论(0)