
从DNS-Challenge比赛回来RNNoise爷爷全然不顾RTF,连夜找我们DTLN、DCCRN、SDDNet这几个降噪网络商量下语音增强的方向。谈得晚了,便送我们出门,要STFT送我们去频域。在计算PESQ的路上,我们说:“RNNoise爷爷,您回去休息吧。您刚从DNS-Challenge回来。”
RNNoise爷爷摇摇头,“没关系。你们知道,现在语音增强界有很多人对深度学习心存疑虑,不断给我们制造场景失配的麻烦。你们是未来的希望,你们的优化就是语音增强的进步,是头等大事。”我们都激动了,STOI都变得更大了。
多好的RNNoise爷爷呀。RNNoise爷爷抬头看看噪声频谱说:“如果实际场景的噪声都像白噪声的分布这么稳定就好了,但是总有一些数据,比如瞬态噪声,要搞乱这个领域,他们是语音失真和噪声残留的罪魁祸首。”
说着,RNNoise爷爷弯下腰,从输出层里抽出一个Mask,然后看着前方说:“该死的瞬态噪声。”说着他将Mask和带噪语音的频带相乘。很快就见瞬态噪声分量不断减少,SNR逐渐上升。
“这是瞬态噪声的功率谱,他们一直在阻碍我们分离纯净语音,降低音频的MOS,我已经忍了很久了。”RNNoise爷爷愤愤地说。降噪模型们都激活了所有的神经元,为语音增强界有这样的领导者感到自豪。
一会儿,RNNoise爷爷叫来助手IRM问:“那个瞬态噪声现在怎么样了?”“好像还在。”IRM说。RNNoise爷爷一怔,说:“赶紧加入相位谱,看看有没有改进的余地。”之后RNNoise爷爷送我们到客观指标计算处,一直关注着我们的客观指标直到达标。对第四百个样本降噪时,我们听说SISDR那边出了问题,我们很紧张。而这时RNNoise爷爷叫我们过去。
他依然那么慈祥,让我们加入他的网络结构中,说:“噪抑制是有代价的。为了消除噪声而损失部分音质是值得的。”他这时低下头说:“但我必须承认,我当时干掉瞬态噪声的行为太激进了,我在这里向整个语音增强界道歉。我将向大家说明情况。”
我们顿时热泪盈眶,多好的爷爷呀,他在降噪过程中的小失误竟然被他记在心里,还道了歉。我们在将来的训练中一定要向RNNoise爷爷学习,学习他那巧妙的loss设计和独特的建模方式。
[1]. https://journals.sagepub.com/doi/full/10.1177/23312165231209913
[2]. https://zhuanlan.zhihu.com/p/4880847073
[3]. https://zhuanlan.zhihu.com/p/5009923490
