java中文文本信息处理07切分词图.pptxVIP

  • 10
  • 0
  • 约2.53千字
  • 约 13页
  • 2022-01-24 发布于北京
  • 举报
Java中文文本信息处理 第七讲切分词图 主讲人: 罗刚 270954928@ 概 述 作业讲解:遍历Trie树 概率语言模型分词原理 形成切分词图 动态规划算法求解最佳切分路径 作业:实现地名切分 切分词图 根据基本词库对句子进行全切分,找出所有可能的词,形成切分词图。 边代表词,边的权重是词的概率。 从切分词图中寻找概率最大的词序列,对应于从有向无环带正权重的图中找最长路径。 其中: 没有考虑未登录词 日期、数字串等可以用规则匹配,不需要考虑它内部的概率。例如2010年3月23日 这样的日期 切分词图 “人民生活水平”的切分词图 切分词图中的点 0 1 2 3 4 5 有 意 见 分 歧 如果待切分的字符串有m个字符,考虑每个字符左边和右边的位置,则有 m+1个点对应,点的编号从0到m。 切分词图 第6页 “有意见分歧”生成的切分词图 意见 分歧 有意 分 见 意 有 0 1 2 3 4 5 路径1: 0-1-3-5 对应切分方案: 有/ 意见/ 分歧/ 路径2: 0-2-3-5 对应切分方案: 有意/ 见/ 分歧/ 计算最大概率等于求切分词图的最长路径 表示切分词图 切分词图的特点: 边比较少,所以是一个稀疏图(Sparse Graph)。稀疏图一般用邻接表表示。 需要找一个节点的前驱词集合,所以用逆邻接表表示。 逆邻接

文档评论(0)

1亿VIP精品文档

相关文档