
腾讯会议天籁实验室携手腾讯AI Lab,共同打造的Penguins,于2021腾讯技术生态大会上正式面世。Penguins是一款超低码率、高质量AI-Codec,支持多种运行模式,以满足RTC场景下多种应用诉求。其核心技术点在于,紧密结合经典信号处理和最新的深度学习技术,最大化提升带宽利用率。比如,在6kbps带宽下,也可提供高清通话质量;较传统技术,编码效率提升300%。本文通过问答的方式,简要介绍Penguins相关的技术要点。

受疫情影响,远程音视频通讯服务迎来了一个巨大的增长。在支撑海量服务的背后,语音编解码技术是其中一项核心技术。语音编码技术,简单讲,就是使用较少的网络带宽资源去尽量多的传递语音信息。从香农信息论的角度来讲,语音编码是一种信源编码,信源编码的目的是在编码端尽可能的压缩我们想要传递信息的数据量,去掉信息中的冗余,同时在解码端还能够无损(或接近无损)地恢复出来。
图1: 语音压缩概念图
现在一些主流的语音编解码器的压缩率都可以达到10倍以上,也就是原本10MB的语音数据经过编码器的压缩只需要1MB来传输,大大降低了传递信息所需消耗的带宽资源。做一个简单的算术题:对于采样率为16000Hz的宽带语音信号,如果采用16-bit采样深度,无压缩版本的码率为256kbps;如果使用语音编码技术,即使是有损编码,在10-20kbps的码率范围内,重建的语音信号的质量可以接近无压缩版本,甚至听感上认为无差别。在通信系统中,各厂商均倾向于部署标准的语音编解码协议,以解决互联互通的问题。常见的标准均来自ITU-T、3GPP、IETF、AVS、CCSA等国际国内标准组织;主流标准包括G.711、G.722、AMR系列、EVS、OPUS等。
语音编码根据编码原理一般可以分为三种:波形编码,参数编码,混合编码。波形编码(waveform speech coding)顾名思义就是直接对语音信号的波形进行编码,这种编码方式的优点是编码语音质量高,但是压缩效率不高。参数编码(parametric speech coding)指的是首先我们需要找到一种声源模型能够对语音发声过程进行建模,将这一模型搭载到接收端机器中,这样我们只需向模型传递少量参数,机器就能模仿人的发声原理产生声音信号,而编码端要做的就是提取我们想要传递的语音信号的对应参数。参数编码的优点是压缩率极高,缺点是恢复语音的质量不高。混合编码(hybrid speech coding)是将上述两种编码方式结合,将能够使用参数编码的语音成分用参数表示,剩下的参数无法有效表达的成分使用波形编码。两者结合能够做到在编码效率高的情况下,语音质量也很高。一般地,上述三种编码原理均来自经典的语音信号建模,我们也称之为基于信号处理的压缩方法。上面提到的主流标准,均采用上述原理。根据率失真分析、并结合过去几十年的标准化经验,我们认为,至少0.75bit/sample的码率才能提供理想的语音质量;对于采样率16000Hz的宽带语音信号,等效于12kbps。比如:OPUS标准推荐16kbps作为提供高质量宽带语音通话的码率。另外,从过往标准化经验看,任何新一代技术的编码效率一般要比前一代高20%。
什么是AI-Codec?
首先,我们介绍经典编码器技术,在不同码率下的质量。如图2,我们给出了原始宽带语音,经过OPUS两种码率压缩的语音的频谱对比。从频谱看,20kbps的编码效果非常接近原始信号,尤其在1000Hz范围内的多个谐波的相似度上。反过来,6kbps的编码效果差强人意,尤其是谐波间的量化噪声过大,频谱非常平(没有完整的谐波形态)。主观上,20kbps的质量接近原声,而6kbps的重建信号有明显的噪感(量化精度不够造成的量化噪声)。因此,经典编码器技术压缩效率不能无限地增长,相关技术已经达到天花板。
图2: 不同码率的频谱对比
(红:原始语音 / 蓝:OPUS@20kbps / 黄:OPUS@6kbps)
近年来,深度学习在语音处理领域获得多个成功应用案例;因此,Penguins的研究项目就在此背景下产生。具体地,通过语音信号建模,提取最核心的特征参数并进行编码;特征向量描述了语音中最核心的成分。通过最新的深度学习网络,预测语音中的精细结构,并生成最终的波形。因此,这里有一种“码率”和“算力”的置换关系。具体地,核心的特征向量只需少量比特进行高精度的编码;深度学习网络,完全承担了预测语音信号的精细结构并输出最终波形。因此,一方面,低码率、高精度编码核心特征向量;另一方面,通过0-比特、深度学习预测精细结构并输出最终波形。最终,只需要少量比特,再加上算力资源,即可高精度生成语音信号。如图3,我们给出了原始宽带语音,相同码率下OPUS和Penguins的频谱对比。从频谱看,即使是6kbps,Penguins编码效果非常接近原始信号,尤其在1000Hz范围内的三个谐波的相似度上。反过来,6kbps的OPUS编码效果差强人意,频谱仍然过“平”,有明显的噪感。图3: 不同码率的频谱对比
(红:原始语音 / 蓝:Penguins@6kbps / 黄:OPUS@6kbps)
下面,我们提供一段试听。从主观体验上,Penguins在6kbps的主观质量,显著优于同码率OPUS;接近OPUS在20kbps的效果。File01_Reference.wav
File02_OPUS6kbps.wav
File03_penguins6kbps.wav
File04_OPUS20kbps.wav
结语
5G乃至未来更强的通信技术发展会带来更丰富的带宽资源,但人们对实时音视频体验的追求也是无止境的。我们不仅需要听得清,还需要听得真。对于实时的全频带音频传输、空间音频技术乃至声场重建等技术,高效率编解码器可以为这些技术带来更可靠有效的基础支持;而且在现实情况中总是会有弱网情况的出现,通过高效编解码节省的资源可以用于抗性提升,保障实时通信的稳定性。因此,Penguins及其未来演进版本的提出,将有非常广阔的应用前景。
文章作者:肖玮