ICTCLAS 中科院分词系统 代码 注释 中文分词 词性标注.docVIP

  • 9
  • 0
  • 约7.57千字
  • 约 10页
  • 2019-10-11 发布于江西
  • 举报

ICTCLAS 中科院分词系统 代码 注释 中文分词 词性标注.doc

ICTCLAS 中科院分词系统 代码 注释 中文分词 词性标注(转) 中科院分词系统概述 这几天看完了中科院分词程序的代码,现在来做一个概述,并对一些关键的数据结构作出解释 〇、总体流程 考虑输入的一句话,sSentence=张华平欢迎您 总体流程: 一、分词 张/华/平/欢迎/您 二、posTagging 张/q 华/j 平/j 欢迎/v 您/r 三、NE识别:人名识别,音译名识别,地名识别 张/q 华/j 平/j 欢迎/v 您/r 张华平/nr 四、重新分词:张华平/欢迎/您 五、重新posTagging: 张华平/nr 欢迎/v 您/r ? 技术细节 一、分词 分词程序首先在其头末添加开始符和结束符 sSentence=始##始张华平欢迎您末##末 然后是分词,基本思想就是分词的得到的词的联合概率最大 假设 张华平欢迎您 分为 w_1/w_2/.../w_k 则 w_1/w_2/.../w_k=argmax_{w_1/w_2/.../w_k}P(w_1,w_2,...,w_k)=argmax_{w_1/w_2/.../w_k}P(w_1)P(w_2)...P(w_k) 细节: 首先给原句按字划分,所有汉字一个一段,连续的字母,数字一段,比如始##始张华平2006欢迎您asdf末##末被划为始##始/张/华/平/2006/欢/迎/您/asdf/末##末 接着找出这个

文档评论(0)

1亿VIP精品文档

相关文档