Kaldi单音素GMM学习笔记
今天我们就推送kaldi里的单音素GMM部分,主要内容如下: 原理 学习资料: 1. 统计学习方法--李航 a) 学习第九章《EM算法》,可跳过9.4节。弄明白EM算法在高斯混合模型(GMM)学习中的应用,搞明白几个公式。 b) 学习第十章…
51 0 0
今天我们就推送kaldi里的单音素GMM部分,主要内容如下: 原理 学习资料: 1. 统计学习方法--李航 a) 学习第九章《EM算法》,可跳过9.4节。弄明白EM算法在高斯混合模型(GMM)学习中的应用,搞明白几个公式。 b) 学习第十章…
这是一篇谷歌语音团队在2018 interspeech上分享。ppt很长,大概180页左右,讲述了谷歌团队如何从CTC、RNN-T、LAS一步一步趟坑过来,然后把LAS做成谷歌线上产品。非常敬佩这个强大的团队,特别感谢他们的分享,这里分享给…
本文主要来跟大家说下基于深度学习的一种特征,瓶颈特征(bottleneck)。此外,还有一个名词叫tandem,这个意思就是把bottleneck特征跟mfcc特征或者plp特征合并在一起使用,往往这么使用效果更好。下面介绍2种bottle…
语音本质是声带的振动,然后经过声道和口腔的调制才产生我们可以听到或拾取的声音,然而通过倒谱(cepstrum)分析语音就能将这一本质的特征参数提取出来。 梅尔倒频谱(Mel-Frequency Spectrum, MFC)是一个可用来代表短…
今天给大家说下如何利用kaldi搭建说话人识别的例子。仅仅是搭建,具体的很多参数的调整需要大家根据数据集的不同慢慢调整。 数据准备:无论使用kaldi来做语音识别还是说话人识别,第一步就是数据准备,对于说话人识别来说,需要准备的几个文件为w…
语音识别分为训练和识别两个过程,训练包含声学模型的训练和语言模型的训练,识别就是大家说的那个过程。通常会通过麦克风来获取音频,这部分一般是系统函数调用获取得到音频数据,一般系统采用16k采样率,16bits,单通道的音频。当然也可能会用到高…