数字信号处理作业之语音识别小论文4.docVIP

下载本文档

18
0
约8.68千字
约 14页
2017-10-14 发布于上海
举报
版权申诉

数字信号处理作业之语音识别小论文4.doc

1、本文档共14页，可阅读全部内容。
2、原创力文档（book118）网站文档一经付费（服务费），不意味着购买了该文档的版权，仅供个人/单位学习、研究之用，不得用于商业用途，未经授权，严禁复制、发行、汇编、翻译或者网络传播等，侵权必究。
3、本站所有内容均由合作方或网友上传，本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺！文档内容仅供研究参考，付费前请自行鉴别。如您付费，意味着您自己接受本站规则且自行承担风险，本站不退款、不进行额外附加服务；查看《如何避免下载的几个坑》。如果您已付费下载过本站文档，您可以点击这里二次下载。
4、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等，请点击“版权申诉”（推荐），也可以打举报电话：400-050-0827(电话支持时间：9:00-18:30)。
5、该文档为VIP文档，如果想要下载，成为VIP会员后，下载免费。
6、成为VIP后，下载本文档将扣除1次下载权益。下载后，不支持退款、换文档。如有疑问请联系我们。
7、成为VIP后，您将拥有八大权益，权益包括：VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
8、VIP文档为合作方或网友上传，每下载1次，网站将根据用户上传文档的质量评分、类型等，对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档

数字信号处理作业之语音识别小论文4

摘要：本文针对语音信号时域、频域参数进行了系统详尽的分析，并在MATLAB环境下实现了基于DTW算法的特定人语音信号的识别。关键词：语音；短时傅立叶引言近年来，语音识别已经成为一个非常活跃的研究领域。在不远的将来，语音识别技术有可能作为一种重要的人机交互手段，辅助甚至取代传统的键盘、鼠标等输入设备，在个人计算机上进行文字录入和操作控制。而在智能家电、工业现场控制等应用场合，语音识别技术则有更为广阔的发展前景。在语音识别中，最为简单有效的方法是采用DTW(Dynamic Time Warping动态时间规整)算法，该算法基于动态规划的思想解决了发音长短不一的模板匹配问题，是语音识别中出现最早、较为经典的一种算法[3]。 MATLAB是一种功能强大、效率高、交互性好的数值计算和可视化计算机高级语言，它将数值分析、信号处理和图形显示有机地融合为一体，形成了一个极其方便、用户界面友好的操作环境。本文就是在MATLAB基础上来进行语音信号参数的分析与语音信号的识别的。一个完整特定人语音识别系统图1　语音识别系统框图语音识别的过程可以被看作模式匹配的过程，模式匹配是指根据一定的准则，使未知模式与模型库中的某一个模型获得最佳匹配的过程。模式匹配中需要用到的参考模板通过模板训练获得。在训练阶段，将特征参数进行一定的处理后，为每个词条建立一个模型，保存为模板库。在识别阶段，语音信号经过相同的通道得到语音特征参数，生成测试模板，与参考模板进行匹配，将匹配分数最高的参考模板作为识别结果。、语音信号的分析是利用PC机录制采用8000kHz采样频率、16bit量化、单声道的PCM录音格式图2 采集的数字语音“3”的原始信号 2、语音信号分析语音信号是一种典型的非平稳信号。时域分析 .1短时能量分析短时能量分析用途：第一，可以区分清音段和浊音段，因为浊音时的短时平均能量值比清音时大得多；第二，可以用来区分声母与韵母的分界、无声与有声的分界、连字的分界等。如对于高信噪比的语音信号，短时平均能量用来区分有无语音。无语音信号噪声的短时平均能量很小，而有语音信号的能量则显著增大到某一个数值，由此可以区分语音信号的开始点或者终止点。 .2短时过零率分析过零就是信号通过零值。对于连续语音信号，可以考察其时域波形通过时间轴的情况。对于离散时间信号，如果相邻的取样值改变符号则称为过零。由此可以计算过零数，过零数就是样本改变符号的次数。单位时间内的过零数称为平均过零数。短时过零分析通常用在端点侦测，特别是用来估计清音的起始位置和结束位置。频域分析短时傅立叶分析在运用离散时间傅立叶变换分析语音信号的变化时，会遇到这样的问题，即单一的傅立叶变换并不能反映时间变化的频谱信息，诸如时变共振峰和谐波。具体而言，通常将信号的每一时刻与其相邻时刻信号的傅立叶变换相联系，这样就可以及时跟踪信号的频谱变化。语音信号的短时傅立叶变换见程序所述。短时傅立叶分析一般采用汉窗作为分析窗。语音信号的处理语音识别DTW算法通常，规整函数被限制在一个平行四边形的网格内，如图所示。它的一条边斜率为2，另一条边斜率为1/2。规整函数的起点是（1, 1），终点为（N，M）。DTW算法的目的是在此平行四边形内由起点到终点寻找一个规整函数，使其具有最小的代价函数，保证了测试模板与参考模板之间具有最大的声学相似特性。图　匹配路径约束示意图由于在模板匹配过程中限定了弯折的斜率，因此平行四边形之外的格点对应的帧匹配距离是不需要计算的。另外，因为每一列各格点上的匹配计算只用到了前一列的3个网格，所以没有必要保存所有的帧匹配距离矩阵和累积距离矩阵。充分利用这两个特点可以减少计算量和存储空间的需求，形成一种高效的DTW算法。图2中，把实际的动态弯折分为三段，（1，xa），（xa+1，xb），（xb+1，N），其中： xa= (2M-N)/3，xb=2(2N-M)/3 xa和xb都取最相近的整数，由此可得出对M和N长度的限制条件： 2M-N≥3，2N-M≥2 当不满足以上条件时，认为两者差别太大，则无法进行动态弯折匹配。在x轴上的每一帧不再需要与y轴上的每一帧进行比较，而只是与y轴上[ymin，ymax]间的帧进行比较，ymin和ymax的计算公式为： ymin=x/2，0≤x≤xb， 2x+(M-2N)，xb x≤N ymax=2x，0≤x≤xa， x/2+(M-N/2)，xa x≤N 如果出现xa xb的情况，则弯折匹配的三段为（1，xb），（xb+1，xa），（xa+1，N）。对于x轴上每前进一帧，虽然所要比较的y轴上的帧数不同，但弯折特性是一样的，累积距离的更新都是用下式实现的： D(x，y) = d(x，y)+min[D(x-1，y)，D(x-1，y-1)，D(x-1，y-2)