- 9
- 0
- 约6.21千字
- 约 8页
- 2021-08-16 发布于湖北
- 举报
基于字的神经网络语言模型训练方法及其系统
背景
语言模型描述语言内部的词语搭配关系,被广泛应用在自然语言处理和语音识别等领域。一个高质量的语言模型对连续语音识别和机器翻译等任务都具有重要意义。
统计语言模型
当前主流的语言模型为基于概率的统计语言模型,即用概率来描述词与词之间的搭配关系和句子产生能力。统计语言模型被广泛应用于各种自然语言处理问题,如中文分词、词性标注、机器翻译、自动摘要等。在语音识别领域,统计语言模型对减小搜索空间,提高识别准确度也具有重要意义[7]。
举例而言,假如输入的拼音串为“nixianzaiganshenme”,对应的汉字输出可以有多种形式,如“你现在在干什么”、“你西安在干什么”,等等,那么到底哪个才是正确的结果呢?利用统计语言模型,我们可以计算出前者的概率大于后者,因此转换成前者在多数情况下更为合理。
具体而言,统计语言模型计算由一串词(w1,w
Ps
由概率的乘法准则可知:
Ps
(1.2)式意味着每一个词wk的出现概率依赖于之前出现的所有词,即(w1,w2,…,wk-1
hk=(w1,
则1.2式写成:
Ps=P
随着句子长度的增加,hk将线性增长,导致模型复杂度过高而无法建模。通常的方法是假设hk只包含wk前面的(n-1)
hk≈
当前主流的统计语言模型是n-gram语言模型。这一模型通过统计词与其历史子串的共现概率来计算Pw
Pw
其中C(s)
原创力文档

文档评论(0)