中文语料库建设分词词性标注语料库计划任务完成情况-中文语言资源库.docVIP

  • 6
  • 0
  • 约6.21千字
  • 约 10页
  • 2019-08-18 发布于北京
  • 举报

中文语料库建设分词词性标注语料库计划任务完成情况-中文语言资源库.doc

中文语料库建设分词词性标注语料库计划任务完成情况-中文语言资源库.doc

当代汉语文本语料库分词、词性标注工作报告 项目名称:中文语料库建设 子项名称:分词词性标注语料库 承担单位:山西大学计算机科学系 负责人: 杨尔弘 分词词性标注语料库是进行汉语信息处理的重要基础资源。而语料库所采集的数据、分词词性标注的规范、加工过程的规范性以及相应的语料库管理系统从本质上决定了语料库的质量、代表性、复用性以及提供的信息的可靠性。 2002年10 月,我单位承担了中文语料库建设的子项目:分词与词性标注语料库的研制任务。按照研究目标:建成带有完整词类标记的当代汉语通用语料库。选取了2002年媒体上流通的文本,力求表现当代语言的最新面貌。针对信息处理的特点,研究确定了本次加工的规范,按照规范采用人机结合的方法,加工完成了500万汉字语料的分词、标注任务,并对歧义切分、未登陆词语(专有名词与普通新词语)、兼类词进行了全面的检验。经过近一年的工作,按计划完成了课题的任务。我们主要进行了如下的研究工作: 完成了500万语料的收集、整理、分类工作。 研究制定了符合信息处理用的汉语分词与词性标注规范。 按照加工规范,全面审核了支持自动分词和自动词性标注的词表。 开发了人工校对的辅助系统,对自动分词和词性标注的结果进行了全面的人工校对。 对语料库加工中的难点问题进行了收集、分析,确定了下一步的研究内容 1.500万语料的收集、整理、分类工作 我们首先进行了语料的收集、选择、分类、

文档评论(0)

1亿VIP精品文档

相关文档