23. 语音识别的原理(2).pptxVIP

  • 5
  • 0
  • 约小于1千字
  • 约 7页
  • 2026-04-06 发布于陕西
  • 举报

人工智能与机器学习基础知识——语音识别的原理

语音识别的原理要对声音进行分析,需要对声音分帧,也就是把声音切开成一小段一小段,每小段称为一帧。分帧后,语音就变成了很多小段,但波形在时域上几乎没有描述能力,因此必须将波形作变换。常见的一种波形变换方法是提取MFCC特征。语音识别就转换为把这个矩阵转变为文本。

语音识别的原理语音识别就转换为把这个矩阵转变为文本。第一阶段第二阶段第三阶段把帧识别成状态把状态组合成音素把音素组合成单词

语音识别的原理语音识别就转换为把这个矩阵转变为文本。每个小竖条代表一帧,若干帧语音对应一个状态,每三个状态组合成一个音素,若干个音素组合成一个单词。如果知道了每帧语音和哪个状态相对应,就完成了语音的识别。

语音识别的原理如果知道了每帧语音和哪个状态相对应,就完成了语音的识别。如何判断每帧音素和哪个状态相对应呢?直观的办法就是,看某帧对应哪个状态的概率最大,那么这帧就属于这个状态。例如,在左图,P(o|s3)表示给定了状态s3,该状态发音为x的概率值。由于这帧对应s3状态的概率最大,因此就让这帧对应于s3状态。

语音识别的原理如何获得每种状态对应的帧呢?——声学模型。声学模型(acousticmodel,AM):包含了大量的参数,通过这些参数,就可以知道帧和状态对应的概率。一般通过“训练”来获取这些参数的值。训练声学模型时,需要使用巨大数量的语音

最近下载

文档评论(0)

1亿VIP精品文档

相关文档