一种中文分词词典存储机制.docxVIP

  • 3
  • 0
  • 约3.53千字
  • 约 4页
  • 2023-09-08 发布于广东
  • 举报
一种中文分词词典存储机制 如果中文文本在书面表达或计算机内显示,则该词与词、词和词之间没有明显的分布标志。对于一句话,人可以通过自己的知识来得到哪些是词,但如何让计算机也能做到这一点,就是中文分词算法的目的。中文分词是中文信息处理的基础,在诸多领域起着至关重要的作用,例如,机器翻译、文本检索、搜索引擎、自动文摘等很多应用都需要以中文分词结果作为基础。一个中文分词算法的好坏,会对其后续的应用产生极大的影响。 现有的分词算法,基本上可以分为三种:机械式分词、理解式分词、统计式分词。在这三种算法中,机械式分词的准确率最高,对于机械式分词,需要一部词典作为后台依据,简单的说是通过将文档中的汉字串与字典中的词相匹配来完成词的切分。这是一种基于字符串匹配的分词方法,它是按照一定的策略将待分析的汉字串与一个(充分大的)机器词典中的词条进行匹配,若在词典中找到某个字符串,则匹配成功(识别出一个词)。按照对文本串的扫描方向的不同,机械分词方法可以分为正向匹配和逆向匹配;按照不同长度优先匹配的情况,可以分为最大(最长)匹配(Maximum Matching Method,简称MM法)和最小(最短)匹配。 正向最大匹配算法的原则是切分出来的词越长越好。因为词越长,包含的信息量就越大。机械式分词算法之所以成为“机械”,是因为这种算法没有考虑任何语法及语义问题,而是单纯的,机械式的将文本与词典中的词相匹配

文档评论(0)

1亿VIP精品文档

相关文档