构造汉语的统计计算语言的模型.pptVIP

  • 4
  • 0
  • 约5.56千字
  • 约 46页
  • 2019-11-10 发布于安徽
  • 举报
汉语分词 * 一些抽取出的新词(二元组) 汉语分词 * 人名识别 规则方法:利用语言规则来进行人名识别。优点:识别较准确;缺点:很难列举所有规则,规则之间往往会顾此失彼,产生冲突,系统庞大、复杂,耗费资源多但效率却不高 统计方法:一种是仅从字、词本身来考虑,通过计算字、词作人名用的概率来实现,另一种结合基于统计的汉语词语边界划分来实现。统计方法占用的资源少、速度快、效率高,但准确率较低。其合理性、科学性及所用统计源的可靠性、代表性、合理性难以保证。搜集合理的有代表性的统计源的工作本身也较难。 混合方法:取长补短 汉语分词 * 一种基于统计和规则的人名识别方法 中文姓名用字特点(82年人口普查结果) 729个姓氏用字 姓氏分布很不均匀,但相对集中 有些姓氏可用作单字词 名字用字分布较姓氏要平缓、分散 名字用字涉及范围广 某些汉字既可用作姓氏,又可用作名字用字 汉语分词 * 人名识别系统资源 语料库:95、96两年的人民日报语料全集。共约4000万字。 人名库:包含共约31000多个人名。是95、96两年人民日报语料的所有人名的集合。 人名库和语料库的一致性对保证统计数据的准确性至关重要。 汉语分词 * 人名识别系统知识库 姓氏用字频率库和名字用字频率库:653个单姓氏,15个复姓,1894个名字用字 汉语分词 * 人名识别系统知识库 名字常用词表 朝阳

文档评论(0)

1亿VIP精品文档

相关文档