- 6
- 0
- 约小于1千字
- 约 6页
- 2019-10-17 发布于湖北
- 举报
Web信息检索与数据抓取 -ICTCLAS分词
北京信息职业技术学院 | 郑淑晖 伊新
数据挖掘-ICTCLAS分词
2
这是最早的中文开源分词项目之一,ICTCLAS在国内973专家组组织的评测中活动获得了第一名,在第一届国际中文处理研究机构SigHan组织的评测中都获得了多项第一名。
数据挖掘-ICTCLAS分词
3
ICTCLAS3.0分词速度单机996KB/s,分词精度98.45%,API不超过200KB,各种词典数据压缩后不到3M.ICTCLAS全部采用C/C++编写,支持Linux、FreeBSD及Windows系列操作系统,支持C/C++、C#、Delphi、Java等主流的开发语言。
数据挖掘- Paoding分词
4
Paoding(庖丁解牛分词)基于Java的开源中文分词组件,提供lucene和solr 接口,具有极 高效率和 高扩展性。引入隐喻,采用完全的面向对象设计,构思先进。
高效率:在PIII 1G内存个人机器上,1秒可准确分词 100万汉字。
高扩展性:采用基于不限制个数的词典文件对文章进行有效切分,使能够将对词汇分类定义。能够对未知的词汇进行合理解析。
数据挖掘- Paoding分词
5
庖丁中文分词库是一个使用Java开发的,可结合到Lucene应用中的,为互联网、企业
原创力文档

文档评论(0)