从事语音降噪增强算法开发多年了,上学期间和入行的前段都是做传统信号处理算法。19年以后基于深度学习的语音降噪模型凭借其优秀的处理效果,一时风头无两,似乎每个人都开始走上了模型降噪的路子。

特别是从2020年微软开始举办的Deep Noise Suppression Challenge – INTERSPEECH 2020(DNS)开始,各个高校、科研院所和相关企业都参与进来施展武艺。后续又举办了Deep Noise Suppression Challenge – ICASSP 2021和Deep Noise Suppression Challenge – INTERSPEECH 2021。


Deep Noise Suppression Challenge - INTERSPEECH 2020 - Microsoft Research

www.microsoft.com/en-us/research/academic-program/deep-noise-suppression-challenge-interspeech-2020/

Deep Noise Suppression Challenge - ICASSP 2021 - Microsoft Research

www.microsoft.com/en-us/research/academic-program/deep-noise-suppression-challenge-icassp-2021/

Deep Noise Suppression Challenge – INTERSPEECH 2021 - Microsoft Research

www.microsoft.com/en-us/research/academic-program/deep-noise-suppression-challenge-interspeech-2021/


比赛中多数只关注实时/非实时性,赛道约束的比较少,对模型的参数量和计算量要求比较开放,所以基本上参赛的模型都把自己武装得很“强壮”,把已知的有用的技巧融合到自己的模型中,更有一些模型基本是模块的排列组合。所以本人非常希望主办方能够开辟一条小模型赛道,可以迅速应用于现实,提升通话品质。

实际工作中,想要模型落地,考虑的可不止这些,目前端侧对算法开销要求比较苛刻,PC还好一些,像手机、平板这些设备的算法落地需要更加严格的模型选型和剪枝、量化。

模型选型,需要从模型的效果、参数量、计算量、占用内存大小、时延等方面着手开始考虑拆解问题,当然了,如果小模型就可以满足降噪的效果需求,那恭喜你,可以跳过下面的步骤,去训练模型、马上就可以工程化落地了。如果小模型不能work,那就需要根据落地设备的存储空间和开销限制,寻找若干个效果远超降噪效果需求的大模型,然后通过压缩手段(剪枝、量化等)将模型的参数量和计算量降下来,过程中可能出现效果下降的现象,这就是一个经验性尝试的打磨过程了。

本文将近些年的经典网络和最近提出的新网络的关键参数、简介、开源代码都整理在这里,目前只是比较简单的梳理汇总,后续会针对每一个模型详细分析或者转载其他博主的优秀文章。希望对语音降噪算法的学习和应用过程有所帮助,如果不准确的地方,请大家批评指正。


模型全景



RNNoise

Jean-Marc Valin

Mozilla Corporation Mountain View, CA, USA

主要思想是将传统信号处理与深度学习相结合来创造一个模型又小速度又快的实时噪声抑制算法。

为了避免使用大量神经元,减少计算量,决定不直接使用语音样本或者能量谱。使用了一种符合人类听觉感知的频率尺度——巴克频带尺度。模型输出22个频带增益,并对22个频带进行插值的方式代替了直接输出多个频谱值。


1.模型框图


2.效果


3.代码

github.com/xiph/rnnoise


4.笔记转载

RNNoise超详细解读

https://zhuanlan.zhihu.com/p/397288851


Wav-U-net

Daniel Stoller Sebastian Ewert Simon Dixon

Queen Mary University of London Spotify

Wave-U-Net 是一种卷积神经网络,适用于音频源分离任务,它直接作用于原始音频波形。 它是 U-Net 架构对一维时域信号的一种变形, 实现端到端音频源分离。通过一系列下采样和上采样块(包括 1D 卷积和下/上采样过程),在多个尺度/抽象级别和时间分辨率上计算特征。


1.模型框图


2.效果


3.代码

github.com/f90/Wave-U-N

Conv-TasNet

Yi Luo, Nima Mesgarani

论文提出了一种全卷积时域音频分离网络—Conv-TasNet,这是 Yi Luo 在继 2017 年提出 TasNet 之后,又一端到端的时域语音分离模型。Conv-TasNet通过使用线性编码器生成了一种对语音波形的表示形式,并针对单个说话人的分离进行了优化。然后将一组加权函数应用于编码器的输出来实现说话人分离。最后使用线性解码器得到分离出的语音波形。使用由一维空洞卷积块组成的时域卷积网络(TCN)计算掩码,这使得网络可以对语音信号的长期依赖性进行建模,同时保持较小的模型尺寸。


1.模型框图


2.效果


3.代码

github.com/kaituoxu/Con


4.笔记转载

【论文笔记之Conv-TasNet】: Surpassing Ideal Time–Frequency Magnitude Masking for Speech Separation

https://blog.csdn.net/wjrenxinlei/article/details/107018571?ops_request_misc=%257B%2522request%255Fid%2522%253A%2522163651850816780265422153%2522%252C%2522scm%2522%253A%252220140713.130102334..%2522%257D&request_id=163651850816780265422153&biz_id=0&utm_medium=distribute.pc_search_result.none-task-blog-2~all~sobaiduend~default-2-107018571.pc_search_result_control_group&utm_term=Conv-TasNet&spm=1018.2226.3001.4187


DC-U-Net

Hyeong-Seok Choi
Department of Transdisciplinary Studies, Seoul National University, Seoul, Korea

DC-Unet 结合了深度复数网络和 Unet 的优点来处理复数值谱图, 利用复数信息在极坐标系下估计语音的幅值和相位。同时提出了 weighted-SDR loss。 该方法是通过许多卷积来提取上下文信息,从而导致较大的模型和复杂度。


1.模型框架



2.weighted-SDR loss


3.效果


4.代码

github.com/chanil1218/D


DPRNN

Yi Luo†∗, Zhuo Chen‡, Takuya Yoshioka‡

†Department of Electrical Engineering, Columbia University, NY, USA

‡Microsoft, One Microsoft Way, Redmond, WA, USA


DPRNN 将长序列输入分割为较小的块(chunk),并迭代地应用块内和块间 RNN,这也导致了模型开销巨大。


1.模型框架


2.效果


3.代码

github.com/ShiZiqiang/d


4.笔记转载

论文研究12:DUAL-PATH RNN for audio separation

blog.csdn.net/qq_43473149/article/details/111353033?ops_request_misc=%257B%2522request%255Fid%2522%253A%2522163671934716780264061811%2522%252C%2522scm%2522%253A%252220140713.130102334.pc%255Fall.%2522%257D&request_id=163671934716780264061811&biz_id=0&utm_medium=distribute.pc_search_result.none-task-blog-2~all~first_rank_ecpm_v1~rank_v31_ecpm-4-111353033.pc_search_result_control_group&utm_term=DPRNN&spm=1018.2226.3001.4187


阅读笔记”Dual-path RNN for Speech Separation“

https://zhuanlan.zhihu.com/p/104606356


PHASEN

Dacheng Yin1, Chong Luo2, Zhiwei Xiong1, and Wenjun Zeng2

1University of Science and Technology of China

2Microsoft Research Asia

PHASEN 可以准确估计信号的幅值和相位信息。创新点如下:

  • 设计了一套双流网络结构(TSB, two-stream block,幅度流和相位流),并且双流之间有信息交互,交互发生在 TSB 模块结束的部分;

  • 设计了频域变换块(FTB,frequency transformation blocks)模块,用于获得频域上的长时间跨度的关系, FTB 分布在 TSB 模块的开始和结束位置, FTB 高效整合全局频域相关性,尤其是谐波相关性, 通过对于 FTB 参数的可视化,发现 FTB 自发地学到了谐波相关性。


1.模型框架



在设计强度流的过程中,发现图像处理中常用的小尺寸二维卷积操作无法处理语音信号中的谐波相关性。不同于自然图像,语音信号在转化为时-频表征时的相关性不仅有邻域成分,而且有谐波成分,而这些谐波相关性是一种分布在频域上的全局相关性。之前的工作中使用的 U-net,空洞卷积等卷积结构都适用于处理邻域相关性,但是无法高效地感受到这种全局频域相关性。为此,提出了频域变换模块(Frequency Transformation Block, FTB)来处理包括谐波在内的全局频域相关性。


FTB 的结构如上图所示,简单来说,它利用注意力(attention)机制来挖掘非邻域(non-local)相关性。在整体架构中,每一个TSB中强度流的输入和输出端各有一个 FTB,确保每一个 TSB 中处理的信息以及双流交互的信息都能关注到谐波相关性。


2.效果


3.代码

github.com/huyanxin/pha


4.笔记转载

AAAI 2020丨从嘈杂视频中提取超清人声,语音增强模型PHASEN已加入微软视频服务

https://zhuanlan.zhihu.com/p/91838605


Demucs

Alexandre Défossez Nicolas Usunier Léon Bottou

Facebook AI Research

Demucs是一个waveform-to-waveform 模型,由U-Net 结构和双向 LSTM构成。双向LSTM的原模型适用于非实时处理,调整为单向LSTM可用于实时处理,但降噪效果会下降。

1.模型框架


2.效果




3.代码

github.com/facebookrese


SuDoRM-RF

Efthymios Tzinis, Zhepei Wang, Paris Smaragdis

University of Illinois at Urbana-Champaign

Adobe Research

全称:SUccessive DOwnsampling and Resampling of Multi-Resolution Features多分辨率特征的连续下采样和重采样。该模型,a)可以部署在资源有限的设备上,b)训练速度快,并实现良好的分离性能,c)在增加参数数量时具有良好的扩展性。适合用于移动设备,能够在有限的浮点运算次数、内存要求和参数数量下获得高质量的音频源分离和较小的时延。

1.模型框架



2.效果


3.代码

github.com/etzinis/sudo


DC-CRN

Yanxin Hu1;∗, Yun Liu2;∗, Shubo Lv1, Mengtao Xing1, Shimin Zhang1, Yihui Fu1, Jian Wu1, Bihong Zhang2, Lei Xie1

1Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi'an, China

2AI Interaction Division, Sogou Inc., Beijing, China

DCCRN组合了DCUNET 和CRN的优势,在相同的模型参数大小情况下,仅用了1/6的DCUNET计算量,就达到了DCUNET的效果。

成就:Interspeech 2020 Deep Noise Suppression (DNS),实时赛道第一名,非实时赛道第二名。

非实时赛道的第一名是Amazon的PoCoNet模型,由于是非实时,就不展开介绍了。


1.模型框架



2.效果


可以看到DCCRN-CL 和DCUNET 参数大小和PESQ指标都很接近,但是DCCRN-CL的计算量是DCUNET的1/6。


3.代码

github.com/huyanxin/Dee

github.com/maggie0830/D


4.笔记转载

Deep Complex Convolution Recurrent Network(DCCRN模型)

blog.csdn.net/weixin_43245268/article/details/119794011?ops_request_misc=%257B%2522request%255Fid%2522%253A%2522163671767516780366566062%2522%252C%2522scm%2522%253A%252220140713.130102334..%2522%257D&request_id=163671767516780366566062&biz_id=0&utm_medium=distribute.pc_search_result.none-task-blog-2~all~sobaiduend~default-3-119794011.pc_search_result_control_group&utm_term=dccrn&spm=1018.2226.3001.4187


DTLN

Nils L. Westhausen and Bernd T. Meyer

Communication Acoustics & Cluster of Excellence Hearing4all Carl von Ossietzky University, Oldenburg, Germany

1.模型框架


2.效果




3.论文

github.com/breizhn/DTLN


4.笔记转载

阅读笔记—DTLN

https://zhuanlan.zhihu.com/p/313343001


Sepformer

Cem Subakan1, Mirco Ravanelli1, Samuele Cornell2, Mirko Bronzi1, Jianyuan Zhong3

1Mila-Quebec AI Institute, Canada,

2Universit`a Politecnica delle Marche, Italy

3University of Rochester, USA

是DPRNN的一个变种算法,主要由multi-head attention 和 feed-forward layers组成。采用了DPRNN引入的双路径框架,并将RNN替换为a multiscale pipeline composed of transformers,可以学习短期和长期依赖关系。


1.模型框架


2.效果


3.代码

github.com/speechbrain/


SN-Net

Chengyu Zheng1*, Xiulian Peng2, Yuan Zhang1, Sriram Srinivasan3, Yan Lu 2

1 Communication University of China

2 Microsoft Research Asia

3 Microsoft Corporation

提出了一种在两分支卷积神经网络中同时建模语音和噪声的新方法。在SN-Net中,这两个分支分别预测语音和噪声。与仅在最终输出层进行信息融合不同,在两个分支之间的多个中间特征域中引入交互模块,以使彼此受益。这种交互可以利用从一个分支学到的特征来抵消不需要的部分,恢复另一个分支缺少的部分,从而增强网络的分离能力。

1.模型框架




2.效果



3.代码

代码未开源


SDD-Net

Andong Li1;2, Wenzhe Liu1;2, Xiaoxue Luo1;2, Guochen Yu1;3, Chengshi Zheng1;2, Xiaodong Li1;2

1Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy ofSciences, Beijing, China

2University of Chinese Academy of Sciences, Beijing, China

3Communication University of China, Beijing, China

Deep Noise Suppression Challenge – INTERSPEECH 2021 第一名

1. 模型框架


2.效果


3.代码

代码未开源


DPCRN

Xiaohuai Le1;2;3, Hongsheng Chen1;2;3, Kai Chen1;2;3, Jing Lu1;2;3

1Key Laboratory of Modern Acoustics, Nanjing University, Nanjing 210093, China

2NJU-Horizon Intelligent Audio Lab, Horizon Robotics, Beijing 100094, China

3Nanjing Institute of Advanced Artificial Intelligence, Nanjing 210014, China

Deep Noise Suppression Challenge – INTERSPEECH 2021 第四名


1.模型框架


2.效果


3.代码

github.com/Le-Xiaohuai-


4.笔记转载

DPCRN: Dual-Path Convolution Recurrent Network for Single Channel Speech Enhancement---论文翻译

blog.csdn.net/caixiaobaideye/article/details/118958325?ops_request_misc=%257B%2522request%255Fid%2522%253A%2522163677353216780274111216%2522%252C%2522scm%2522%253A%252220140713.130102334..%2522%257D&request_id=163677353216780274111216&biz_id=0&utm_medium=distribute.pc_search_result.none-task-blog-2~all~baidu_landing_v2~default-1-118958325.pc_search_result_control_group&utm_term=DPCRN&spm=1018.2226.3001.4187


作者丨Taylor