- 1、本文档共72页,可阅读全部内容。
- 2、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。
- 3、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载。
- 4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
查看更多
中文文本信息处理的原理与应用 VOLSUNGA算法 CLAWS算法的改进 一是最佳路径的选择,沿着从左至右的方向,采用“步步为营”的策略,对于当前考虑的词,只保留通往该词的最佳路径,舍弃其它路径,然后再从这个词出发,将这个路径同下一个词的所有标记进行匹配,继续找出最佳的路径,舍弃其它路径,步步前进,直到整个跨段走完,得出整个跨段的最佳路径作为结果输出。 二是用每个词的输出概率来辅助最佳路径的选择。 中文文本信息处理的原理与应用 算法(总结) 存在问题:浮点溢出 改进方法 对概率取负对数,将积最大值问题转化为和最小值问题 算法实质 CLAWS:穷举法 VOLSUNGA:贪心算法 Viterbi:动态规划 中文文本信息处理的原理与应用 自动词性标注方法 方法分类 CLAWS算法 VOLSUNGA算法 Viterbi算法(见前) 举例分析 中文文本信息处理的原理与应用 举例分析(续1) “报道新闻了” 跨段:“,/w 报道/n-v 新闻/n 了/u-v-y ,/w” 转移概率/费用矩阵TC(部分) 中文文本信息处理的原理与应用 举例分析(续2) 输出概率/费用EC 中文文本信息处理的原理与应用 举例分析(续3) 多部图 中文文本信息处理的原理与应用 举例分析(续4) CLAWS 路径1:w-n-n-u-w 费用1:cost1=TC[w,n]+TC[n,n]+TC[n,u]+TC[u,w]=2.09+1.76+2.40+2.22=8.47 路径2:w-n-n-v-w 费用2:cost2=TC[w,n]+TC[n,n]+TC[n,v]+TC[v,w]=2.09+1.76+1.71+1.85=7.41 路径3:w-n-n-y-w 费用3:cost3=TC[w,n]+TC[n,n]+TC[n,y]+TC[y,w]=2.09+1.76+5.10+0.08=9.03 路径4:w-v-n-u-w 费用4:cost4=TC[w,v]+TC[v,n]+TC[n,u]+TC[u,w]=1.90+1.72+2.40+2.22=8.24 路径5:w-v-n-v-w 费用5:cost5=TC[w,v]+TC[v,n]+TC[n,v]+TC[v,w]=1.90+1.72+1.71+1.85=7.18 路径6:w-v-n-y-w 费用6:cost6=TC[w,v]+TC[v,n]+TC[n,y]+TC[y,w]=1.90+1.72+5.10+0.08=8.80 由此可见,路径5的费用最小,最佳标记序列T=(v,n,v) 故标注结果为:报道/v 新闻/n 了/v 中文文本信息处理的原理与应用 举例分析(续5) VOLSUNGA Step1:min{TC[w,n]+EC[报道|n], TC[w,v]+EC[报道|v]} = min{2.09+8.22,1.90+5.69} T[1] = v Step2:min{TC[v,n]+EC[新闻|n]} = min{1.72+6.55} T[2] = n Step3:min{TC[n,u]+EC[了|u], TC[n,v]+EC[了|v], TC[n,y]+EC[了|y]} = min{2.40+1.98,1.71+7.76,5.10+0.38} T[3] = u 由此得到,最佳标记序列T=(v,n,u) 故标注结果为:报道/v 新闻/n 了/u 中文文本信息处理的原理与应用 Viterbi 说明:cost(k,t) = min{TC[t,s] + cost(k+1,s)} + EC[wk|t] 其中cost(k,t)表示第k个词语取词性t所代表的顶点至终点的累计最小费用,s表示第k+1个词语的一个词性,wk表示第k个词语 Step1:k = 3 cost(3,u)=min{TC[u,w]+cost(4,w)}+EC[了|u]=min{2.22+0}+1.98=4.20 cost(3,v)=min{TC[v,w]+cost(4,w)}+EC[了|v]=min{1.85+0}+7.76=9.61 cost(3,y)=min{TC[y,w]+cost(4,w)}+EC[了|y]=min{0.08+0}+0.38=0.46 Step2:k = 2 cost(2,n)=min{TC[n,u]+cost(3,u), TC[n,v]+cost(3,v),TC[n,y]+cost(3,y)}+EC[新闻|n] =min{2.40+4.20,1.71+9.61,5.10+0.46}+6.55=12.11 Step3:k = 1 cost(1,n)=min{TC[n,n]+cost(2,n)}+EC[报道|n]=min{1.7
您可能关注的文档
- 《旅游景区经营与管理》课件-2 旅游景区的区位选择与布局分区.ppt
- 《旅游景区经营与管理》课件-6 旅游景区的经营与营销.ppt
- 《旅游景区经营与管理》课件-9 旅游景区人力资源管理与服务质量管理.ppt
- 《旅游景区经营与管理》课件-10 旅游景区环境管理.ppt
- 《旅游可持续发展》课程教学课件 03-生态旅游产业.ppt
- 《旅游可持续发展》课程教学课件 04-生态旅游的质量控制.ppt
- 《旅游可持续发展》课程教学课件 05-生态旅游政策与规划.ppt
- 《旅游可持续发展》课程教学课件 07-香港郊野公园:都市里的生态旅游.ppt
- 《旅游可持续发展》课程教学课件 08-香港城市发展·土地制度·郊野公园.ppt
- 《旅游可持续发展》课程教学课件 09-旅游环境影响评价(EIA).ppt
文档评论(0)