语音识别之MFCC特征提取精选.pptVIP

  1. 1、原创力文档(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
  2. 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  3. 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  4. 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  5. 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  6. 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  7. 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 二、Cepstrum Analysis 峰值表示语音的主要频率成分,我们把这些峰值称为共振峰(formants) 共振峰携带了声音的辨识属性(就是个人身份证一样,所以它特别重要)。用它就可以识别不同的声音。 如何提取? 二、Cepstrum Analysis 语音信号序列 时域:x(n)=h(n)*e(n) 频域:X(K)=H(K)E(K) 为了较好地将语音信号中的激励信号和声道响应分离 倒谱:log||X[k] ||= log ||H[k] ||+ log ||E[k] || 二、Cepstrum Analysis 慢变化的包络 快变化的周期化细致结构 二、Cepstrum Analysis 我们需要把这两部分分离开--卷积同态系统 二、Cepstrum Analysis Shanghai Jiao Tong University 这里,这段语音被分为很多帧,每帧语音都对应于一个频谱(通过短时FFT计算),频谱表示频率与能量的关系。在实际使用中,频谱图有三种,即线性振幅谱、对数振幅谱、自功率谱(对数振幅谱中各谱线的振幅都作了对数计算,所以其纵坐标的单位是dB(分贝)。这个变换的目的是使那些振幅较低的成分相对高振幅成分得以拉高,以便观察掩盖在低幅噪声中的周期信号) * 先将其中一帧语音的频谱通过坐标表示出来 * 现在我们将左边的频谱旋转90度。得到中间的图 * 然后把这些幅度映射到一个灰度级表示(也可以理解为将连续的幅度量化为256个量化值?),0表示黑,255表示白色。幅度值越大,相应的区域越黑 那为什么要这样呢?为的是增加时间这个维度,这样就可以显示一段语音而不是一帧语音的频谱,而且可以直观的看到静态和动态的信息。优点稍后呈上。 * 我们会得到一个随着时间变化的频谱图,这个就是描述语音信号的spectrogram声谱图。 * 下图是一段语音的声谱图,很黑的地方就是频谱图中的峰值(共振峰formants) * 首先,音素(Phones)的属性可以更好的在这里面观察出来。 * 另外,通过观察共振峰和它们的转变可以更好的识别声音。 * 隐马尔科夫模型(Hidden Markov Models)就是隐含地对声谱图进行建模以达到好的识别性能。 还有一个作用就是它可以直观的评估TTS系统(text to speech)的好坏,直接对比合成的语音和自然的语音声谱图的匹配度即可 * 峰值是随时间变化的,我们要提取的不仅仅是共振峰的位置,还得提取它们转变的过程。 所以我们提取的是频谱的包络(Spectral Envelope)。这包络就是一条连接这些共振峰点的平滑曲线 语音信号的短时谱等于激励源频谱和滤波器频谱的乘积; 峰值是随时间变化的,我们要提取的不仅仅是共振峰的位置,还得提取它们转变的过程。 所以我们提取的是频谱的包络(Spectral Envelope)。这包络就是一条连接这些共振峰点的平滑曲线 峰值是随时间变化的,我们要提取的不仅仅是共振峰的位置,还得提取它们转变的过程。 所以我们提取的是频谱的包络(Spectral Envelope)。这包络就是一条连接这些共振峰点的平滑曲线 (人的听觉对频率是有选择性的) * 1)先对语音进行预加重、分帧和加窗; 2)对每一个短时分析窗,通过FFT得到对应的频谱; 3)计算每一帧的能量谱估计 4)将上面频谱通过Mel滤波器组得到Mel频谱; 5)在Mel频谱上面进行倒谱分析,取对数, 6)做逆变换,实际逆变换一般是通过DCT离散余弦变换来实现,取DCT后的第2个到第13个系数作为MFCC系数),获得Mel频率倒谱系数MFCC,这个MFCC就是这帧语音的特征; * 语音识别之MFCC特征提取 报告人:汤旭国 学号:1130349093 * 语音识别应用 预处理模块:对输入的原始语音信号进行处理 滤除掉不重要的信息及背景噪声 语音分帧(近似认为语音信号在10-30ms内是短时平稳的) 预加重(提升高频部分)等处理 特征提取: 去除语音信号中对于语音识别无用的冗余信息 保留反映语音本质特征的信息 即提取出反映语音信号特征的关键特征参数形成特征矢量 序列,以便用于后续处理 声学模型训练: 根据训练语音库的特征参数训练出声学模型参数 在识别时可以将待识别的语音的特征参数同声学模型进行匹配,得到识别结果。 语言模型训练: 语言模型是用来计算一个句子出现概率的概率模型。 它主要用于决定哪个词序列的可

文档评论(0)

此项为空 + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档