分词技术--web信息检索与数据抓取-ictclas分词.pptxVIP

  • 6
  • 0
  • 约小于1千字
  • 约 6页
  • 2019-10-17 发布于湖北
  • 举报

分词技术--web信息检索与数据抓取-ictclas分词.pptx

Web信息检索与数据抓取 -ICTCLAS分词 北京信息职业技术学院 | 郑淑晖 伊新 数据挖掘-ICTCLAS分词 2 这是最早的中文开源分词项目之一,ICTCLAS在国内973专家组组织的评测中活动获得了第一名,在第一届国际中文处理研究机构SigHan组织的评测中都获得了多项第一名。 数据挖掘-ICTCLAS分词 3 ICTCLAS3.0分词速度单机996KB/s,分词精度98.45%,API不超过200KB,各种词典数据压缩后不到3M.ICTCLAS全部采用C/C++编写,支持Linux、FreeBSD及Windows系列操作系统,支持C/C++、C#、Delphi、Java等主流的开发语言。 数据挖掘- Paoding分词 4 Paoding(庖丁解牛分词)基于Java的开源中文分词组件,提供lucene和solr 接口,具有极 高效率和 高扩展性。引入隐喻,采用完全的面向对象设计,构思先进。 高效率:在PIII 1G内存个人机器上,1秒可准确分词 100万汉字。 高扩展性:采用基于不限制个数的词典文件对文章进行有效切分,使能够将对词汇分类定义。能够对未知的词汇进行合理解析。 数据挖掘- Paoding分词 5 庖丁中文分词库是一个使用Java开发的,可结合到Lucene应用中的,为互联网、企业

文档评论(0)

1亿VIP精品文档

相关文档