- 4
- 0
- 约4.11千字
- 约 11页
- 2018-11-30 发布于福建
- 举报
分词不一致不同成因自动识别研究
分词不一致不同成因自动识别研究
一、引言
一个高质量、大规模的分词语料库是中文信息处理的根基。目前机器自动分词的正确率已达到97%左右,但由于校对者受语境干扰和自身语感的差异,时常会出现一个字串的意义、功能都是确定的但给出了不同的切分形式的情况,我们称之为分词变异。由于意义、功能是否确定在分词层面机器难以判断,因此分词变异的外在表现和组合型歧义相同,同时,在一些专名和非专名串之间也存在着类似的问题。多种成因共同导致了复杂的分词不一致现象:一个相同的字串(不考虑它的意义、功能)在语料库中存在着不同的切分形式。
孙茂松(1999)认为:衡量一个语料库质量的重要标准之一是分词后的语料库是否具有比较高的一致性。因此,建设一个高质量的语料库,分词不一致的处理是一个无法回避的问题,而处理的前提和关键就是识别出分词不一致的不同成因。
本文提出了一种基于机器学习的分词不一致自动识别方案,通过两遍识别,以特征词法识别结果为基础,让机器从中学习到规则后辅以人工规则再处理第一遍未识别的不一致字串。既解决了单一使用特征词法召回率过低和单一使用规则法容易忽视小规则的问题,也克服了原先方法前期需要投入大量人力进行人工校对和规则总结的缺陷。
我们从1998年1月《人民日报》200万字的语料库中抽取到40 926个分词不一致字串,将字串相同的归为1组,共1797组。从中抽样
原创力文档

文档评论(0)