一种快速中文分词机制.docxVIP

  • 0
  • 0
  • 约7.95千字
  • 约 8页
  • 2023-09-08 发布于广东
  • 举报
一种快速中文分词机制 随着中文网络覆盖的大规模发展,包含中文信息的网络数据也在迅速扩张。长期以来,对中国网络数据的实时分析和处理已成为下一代中国信息处理技术必须关注的问题。作为中国信息事务管理的基础,它已广泛应用于汉语搜索、人工智能、信息提取、文本搜索等领域。 成功的中文分词机制需要同时具有较高的词汇切分准确性和快速的词汇切分能力.其中,前者需要解决未登录词汇(out-of-vocabulary)识别和词汇歧义切分等难题,目前主要采用字符串频度统计,语料字词标注等机器学习方法;而快速词汇切分能力是关系到整个中文信息处理系统,特别是实时处理类应用系统可用性的关键技术,目前主要通过设计高效的分词词典机制来实现速度提升.此类快速分词机制一般基于传统的词典分词方法,依靠已有的特征词典作为文本切分匹配依据,设计简单,实现容易,算法效率很高, 词典法分词机制中与分词速度相关的有2个要素:词典构造方法和词汇匹配方法,这2个方面相互关联.常见的词汇匹配方法有前向匹配、后向匹配、最大匹配、逐字匹配等.目前研究认为,采用前向最大匹配是分词速度最高的匹配方法.本文不研究匹配方法造成的分词速度差异,主要通过研究不同词典的构造方法来实现高速的分词机制. 文中第1部分简单描述了几种经典分词词典机制;第2部分详细介绍几种改进词典机制;在第3部分介绍作者提出的一种快速中文分词词典构造机制:双字词和长词哈希索引机

文档评论(0)

1亿VIP精品文档

相关文档