基于统计和语义信息的中文分词算法研究-计算机科学与技术专业论文.docxVIP

  • 17
  • 0
  • 约5.03万字
  • 约 64页
  • 2019-03-28 发布于上海
  • 举报

基于统计和语义信息的中文分词算法研究-计算机科学与技术专业论文.docx

基于统计和语义信息的中文分词算法研究学位论文完成日期:指导教师签字:剽名答辩委员会成员签字:d碾k翻动阂挺。堋嗑/。弼杉禾瓠一万方数据青岛科技大学研究生学位论文基于统计和语义信息的中文分词算法研究摘要随着中文分词技术研究的不断深入,如何实现分词算法中语义信息的处理成为当今研究热点之一。本文结合特定领域的领域性以及语义网本体的结构特点,对基于词典的双向最大匹配算法进行改进,提出基于统计和语义信息的中文分词算法,并开发了中文分词系统对该算法进行验证,最后通过与NLPIR汉语分词系统的分词结果比较,实验表明在特定领域本文提出的算法比传统分词方法有效。针对以上内容,本文主要做了以下五方面工作:1.根据OWL标准构建一个平面几何领域本体。借助维基百科和语义相关度知识了解平面几何领域概念知识以及层次结构,从中抽取30个领域术语,运用领域本体中的四种基本关系完成对术语之间关系的半自动标注和校对,构建起语义相关的数据库,并完成对该领域本体的编辑管理。2,提出一种基于统计规则的歧义消解算法。考虑到歧义字段对切分精度的重大影响,在分析现有歧义处理方法的基础上,总结规律发现问题,提出五条统计规则,并根据统计规则设计实现一种针对交集型歧义的处理算法。3.提出一种基于语义信息的中文分词算法。该算法是对传统的基于词典的双向最大匹配算法进行改进,通过构建平面几何领域本体作为语义词典来代替传统的中文分词词典,将待

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档