数学建模语言识别.pdfVIP

  • 5
  • 0
  • 约1.92万字
  • 约 16页
  • 2017-08-24 发布于河南
  • 举报
数学建模语言识别

垃圾观点文档识别 摘 要 目前商务网站或博客论坛允许用户发表针对产品或话题的一些评论看法,难免会存 在一些垃圾观点评论信息,本文建立了文本相似性模型,对垃圾评论进行识别。 问题一,本文搜集了iPhone6 Plus 的相关评测文章,根据TF-IDF 算法提取出特征词 汇及权重建立产品的特征词库,将题目所列评论进行分词,保留名词、动词和形容词,并 去除停用词,建立文本相似度计算模型,分别计算评论与特征词库和垃圾词库的文本相似 度数值,得到二维的评价指标,设定一定的阀值筛选出正常评论和垃圾评论。根据准确率 的计算方法,得到问题一中评论的识别率。 问题二,在问题一的基础上,本文依然选取iPhone6 Plus 作为目标产品,并且沿用 问题一中的产品特征词库。首先利用中科院成熟的分词系统进行分词,提高评论分词的效 率,分别对模型进行两个方面的改进:(1)在初步过滤显式垃圾评论中,识别重复评论并 过滤;(2 )在识别隐式垃圾模型中,增加词语相似度的计算。 问题三,题目要求的一般产品,文章讨论了不同产品的特征词库的特点,建立了多文 档TF-IDF 算法模型计算特征词及权重,另外在上述模型的基础上,

文档评论(0)

1亿VIP精品文档

相关文档