- 0
- 0
- 约5.09千字
- 约 1页
- 2026-07-22 发布于北京
- 举报
我们的主旨在于探索基于字标注方法的中文分词局部模型,以及比较其与全局模型的优劣。为了能更好地理解该问题,我们需要回顾一些背景知识。事实上,你总要牺牲些什么——以字标注方法处理中文分词问题的局部模型及与全局模型的比较刘博伦任万凤数学科学学院-北京大学层级一:字(C)层级二:词法信息(T)字标注层级三:词性标注(POS)层级四:句法信息(PH)用于处理中文分词问题的数学模型 在独立性假设1.2的基础上,我们可以进一步假设,不同特征,对某一个汉字的标注结果的影响,存在某种独立性,即关系假设3.3Stochastic-Context-Free-Grammar关系假设3.2Na?ve-Bayes关系假设3.1Log-Linear给定特征,对任意语义片段,任意分词结果,认为,其中,这样给定一段文本序列,便可计算以其可能的分词结果作为表层结构的各语法树出现的联合概率,即,与边际概率认为某棵完整语法树出现的概率,可由组成它的某些子树出现的概率,按照一定的规则计算出来。在建立了语法树后,可将其拆成若干子树;使用全部层级的信息使用层级一、二、三的信息特征选择假设3特征选择假设2特征选择假设1层级一:字(C)层级二:词法信息(T)层级三:词性标注(POS)层级四
原创力文档

文档评论(0)