面向大规模信息检索的中文分词技术研究.pptVIP

  • 1
  • 0
  • 约9.23千字
  • 约 10页
  • 2022-05-19 发布于四川
  • 举报

面向大规模信息检索的中文分词技术研究.ppt

七、实验结果和分析 分词测试: 评测指标: 未登录词识别准确率 未登录词识别召回率 登录词识别召回率 七、实验结果和分析 分词测试结果 平均切分速度(MB/S) IRSEG 2.1 ICTCLAS 0.87 FMM 20 表7 分词算法切分速度比较 七、实验结果和分析 分词测试结果 表8 pku语料库测试结果 P R Povv Rovv RIV IRSEG 0.933 0.921 0.804 0.653 0.982 ICTCLAS 0.920 0.911 0.641 0.599 0.981 FMM 0.856 0.887 0.000 0.000 0.952 分词和大规模中文信息检索之间的关系探讨 分词精度与检索性能的实验比较( Fuchun Peng等,2002) 测试数据:TREC-5和TREC-6的中文测试集 检索系统:OKAPI系统 三种分词算法: 基于词典的前向最大匹配-71%和85% 基于文本压缩的PPM算法-90%和95% 基于EM的自监督算法-44%,49%,53%,56%,59%,70%,75%,77% 分词和大规模中文信息检索之间的关系探讨 图2 Kd=10时的12组检索结果比较 分词和大规模中文信息检索之间的关系探讨 原因: 查询切分和文档切分采用相同的分词算法,有一些文件切分错误的词,在查询时也遇到相同的切分错误,所以即使切分

文档评论(0)

1亿VIP精品文档

相关文档