语音识别之MFCC特征提取.pptVIP

  1. 1、有哪些信誉好的足球投注网站(book118)网站文档一经付费(服务费),不意味着购买了该文档的版权,仅供个人/单位学习、研究之用,不得用于商业用途,未经授权,严禁复制、发行、汇编、翻译或者网络传播等,侵权必究。。
  2. 2、本站所有内容均由合作方或网友上传,本站不对文档的完整性、权威性及其观点立场正确性做任何保证或承诺!文档内容仅供研究参考,付费前请自行鉴别。如您付费,意味着您自己接受本站规则且自行承担风险,本站不退款、不进行额外附加服务;查看《如何避免下载的几个坑》。如果您已付费下载过本站文档,您可以点击 这里二次下载
  3. 3、如文档侵犯商业秘密、侵犯著作权、侵犯人身权等,请点击“版权申诉”(推荐),也可以打举报电话:400-050-0827(电话支持时间:9:00-18:30)。
  4. 4、该文档为VIP文档,如果想要下载,成为VIP会员后,下载免费。
  5. 5、成为VIP后,下载本文档将扣除1次下载权益。下载后,不支持退款、换文档。如有疑问请联系我们
  6. 6、成为VIP后,您将拥有八大权益,权益包括:VIP文档下载权益、阅读免打扰、文档格式转换、高级专利检索、专属身份标志、高级客服、多端互通、版权登记。
  7. 7、VIP文档为合作方或网友上传,每下载1次, 网站将根据用户上传文档的质量评分、类型等,对文档贡献者给予高额补贴、流量扶持。如果你也想贡献VIP文档。上传文档
查看更多
语音识别之MFCC特征提取

语音识别之MFCC特征提取 报告人:汤旭国 学号:1130349093 3/30/2017 语音识别应用 预处理模块:对输入的原始语音信号进行处理 滤除掉不重要的信息及背景噪声 语音分帧(近似认为语音信号在10-30ms内是短时平稳的) 预加重(提升高频部分)等处理 特征提取: 去除语音信号中对于语音识别无用的冗余信息 保留反映语音本质特征的信息 即提取出反映语音信号特征的关键特征参数形成特征矢量 序列,以便用于后续处理 声学模型训练: 根据训练语音库的特征参数训练出声学模型参数 在识别时可以将待识别的语音的特征参数同声学模型进行匹配,得到识别结果。 语言模型训练: 语言模型是用来计算一个句子出现概率的概率模型。 它主要用于决定哪个词序列的可能性更大,或者在出现了几个词的情况下预测下一个即将出现的词语的内容。 语音解码和有哪些信誉好的足球投注网站算法: 针对输入的语音信号,根据己经训练好的HMM声学模型、语言模型及字典建立一个识别网络 根据有哪些信誉好的足球投注网站算法在该网络中寻找最佳的一条路径,这个路径就是能够以最大概率输出该语音信号的词串 语音是怎么产生 人通过改变声道的shape发出的不同声音。声道的shape包括舌头,牙齿等。 我们可以分析不同声道产生的语音短时功率谱的包络识别语音 MFCCs(Mel Frequency Cepstral Coefficents)是一种能准确描述这个包络的特征,在语音识别人工特征方面,可谓是一枝独秀 主要的几个概念 声谱图(Spectrogram) 倒谱分析(Cepstrum Analysis) Mel频率分析(Mel-Frequency Analysis) 梅尔倒频谱系数(Mel-Frequency Cepstral Coefficients) 一、声谱图(Spectrogram) FFT FFT FFT 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 一、声谱图(Spectrogram) 二、Cepstrum Analysis 峰值表示语音的主要频率成分,我们把这些峰值称为共振峰(formants) 共振峰携带了声音的辨识属性(就是个人身份证一样,所以它特别重要)。用它就可以识别不同的声音。 如何提取? 二、Cepstrum Analysis 语音信号序列 时域:x(n)=h(n)*e(n) 频域:X(K)=H(K)E(K) 为了较好地将语音信号中的激励信号和声道响应分离 倒谱:log||X[k] ||= log ||H[k] ||+ log ||E[k] || 二、Cepstrum Analysis 慢变化的包络 快变化的周期化细致结构 二、Cepstrum Analysis 我们需要把这两部分分离开--卷积同态系统 二、Cepstrum Analysis 二、Cepstrum Analysis 二、Cepstrum Analysis Mel-Frequency Analysis 现在给我们一段语音,我们可以得到它的频谱包络(连接所有共振峰值点的平滑曲线) 理论我们可以得到特征向量,但是 Mel-Frequency Analysis 人类听觉感知的实验表明: 听觉系统是一个特殊的非线性系统,它响应不同频率信号的灵敏度是不同的,人耳就像一个滤波器组 这些滤波器在频率坐标轴上不是统一分布的 在低频区域,分布密集 在高频区域,分布稀疏 如果在语音识别系统中能模拟人类听觉感知处理特点,就有可能提高语音的识别率 Mel-Frequency Analysis 梅尔频率倒谱系数(Mel Frequency Cepstrum Coefficient, MFCC)考虑了人类的听觉特征,先将线性频谱映射到基于听觉感知的Mel非线性频谱中。 提取特征流程图 至此,特征向量提取完毕, 这样就可以通过这些倒谱向量对语音分类器进行训练和识别 主要参考资料: 现代信号处理讲义 /miscellaneous/machine-learning/guide-mel-frequency-cepstral-coefficients-mfccs/ cmu语音技术教程/15-492/slides/ /zouxy09/article/details/9156785 谢 谢!

文档评论(0)

yy558933 + 关注
实名认证
文档贡献者

该用户很懒,什么也没介绍

1亿VIP精品文档

相关文档