基于上下文和语义信息的跨领域中文分词-中文信息技术专业委员会.pptVIP

  • 1
  • 0
  • 约小于1千字
  • 约 25页
  • 2020-02-10 发布于浙江
  • 举报

基于上下文和语义信息的跨领域中文分词-中文信息技术专业委员会.ppt

基于上下文和语义信息的跨领域中文分词 ;主要内容;中文分词概况;主要内容;中文分词的一大挑战;主要内容;本文主要方法;本文主要方法 ——模型及特征;本文主要方法 ——模型及特征;本文主要方法 ——模型及特征;本文主要方法;本文主要方法 ——上下文及语义信息;NLPMT;本文主要方法;跨领域分词的分词算法流程如下:;NLPMT;NLPMT;NLPMT;本文主要方法;实验数据: 系统词典是从2000年1-6月份的人民日报中抽取出来的,词性体系为相应的北大词性体系,词典中共含有85,000个词。 本文采用的语义资源是同义词词林(扩展版),共包含77,343条词语。 SIGHAN 2010的跨领域简体中文训练和测试语料。 训练基于词图的CRFs模型时,所用的语料是有词性标注的评测语料(1998年1月份人民日报)。 ;NLPMT; 该方法用基于字标注的CRFs模型得到3-Best路径,将路径中包含的所有候选词添加到词图中,充分利用篇章的上下文信息和同义词语义信息,在词的层面上从词图中选择代价最小的路径作为最终的分词结果。 该方法很好地发挥了基于字标注的方法在发现未登录词上的能力,而且在分词过程中充分利用词汇的领域性信息,提高了领域性分词的分词结果。 用Bakeoff 2010简体中文测试语料进行开式测试,

文档评论(0)

1亿VIP精品文档

相关文档