- 14
- 0
- 约4.78千字
- 约 10页
- 2017-05-27 发布于河南
- 举报
中文分词2
suntian@ 实验1 实现基于FMM或BMM的分词系统 1.从标注语料中生成词典 2.利用词典构建FMM或BMM分词 基于切分图的小型分词系统 1.从标注语料中生成词典 2.利用标注语料生成二元模型 3.利用词典构建切分全路径,或切分图 4.从切分图中选择切分结果 判别式分词(Cont.) 特征选择 设H是预定义条件的集合,T是一组可选标注集,条件随机场的特征函数定义为: 判别式分词(Cont.) 特征所涉及的语言学知识列表 字的上下文知识 形态词知识:处理重叠词、离合词、前后缀 仿词知识:2000年 成语/惯用语知识 普通词词典知识 歧义知识 新词知识/用户词典 新词的全局化知识 判别式分词(Cont.) CRF建模 判别式分词(Cont.) 训练 判别式分词(Cont.) 分词 判别式分词(Cont.) 优点 理论基础扎实 解码速度快 分词精度高 新词识别能力强 所需学习素材少 弱点 训练速度慢 需要高配置的机器训练 内容提要 分词概述 分词技术发展 国际分词评测 分词技术总结 国际分词评测 SIGHAN(/) 国际计算语言学协会下属的处理中文的兴趣小组,旨在促进中文自然语言处理技术交流合作,组织中文语言处理技术评测,共同推动中文信息处理技术进步。SIGHAN组织的中文分词/未登录词识别评测为学术界和工业界提供了一个评测技术优劣的舞台,是目前中文语言处理方面最具
原创力文档

文档评论(0)