分享8篇通义实验室在 INTERSPEECH 2024 和 ACL 2024 中稿的论文,涵盖音频理解与生成、语音情感表示、语音合成、语音分离、说话人验证、自动语音识别等多个技术方向。

INTERSPEECH是国际语音通讯协会(ISCA)组织的年度会议,为全球语音处理和通讯领域最重要的会议之一。ACL是自然语言处理领域的旗舰会议之一,致力于促进计算语言学及其相关领域的研究。


Phonetic Enhanced Language Modeling for Text-to-Speech Synthesis

论文作者:Kun Zhou, Shengkui Zhao, Yukun Ma, Chong Zhang, Hao Wang, Dianwen Ng, Chongjia Ni, Nguyen Trung Hieu, Jia Qi Yip, Bin Ma

论文单位:阿里巴巴集团
核心内容:最近的基于语言模型的文本到语音(TTS)框架展示了可扩展性和上下文学习能力。然而,它们由于在自回归语言建模过程中对语音单元预测的错误累积而存在鲁棒性问题。在本文中,我们提出了一种音素增强的语言建模方法来提高TTS模型的性能。我们利用富含音素信息的自监督表征作为自回归语言模型的训练目标。随后,采用非自回归模型来预测包含细粒度声学细节的离散声学编码。TTS模型在自回归训练期间仅关注语言建模,从而减少了在非自回归训练中发生的错误传播。通过客观和主观评估,我们验证了所提方法的有效性。

论文:https://arxiv.org/pdf/2406.02009

ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency

论文作者:Yafeng Chen, Siqi Zheng, Hui Wang, Luyao Cheng, Qian Chen, Shiliang Zhang, Junjie Li

论文单位:阿里巴巴集团,中国科学技术大学
核心内容:随着测试语音时长的减少,说话人识别系统的性能会迅速下降。为此,一种有效的多尺度特征融合网络ERes2Net被投入使用。然而由于模型规模的限制,ERes2Net在短时间内的说话人识别任务上仍表现不佳。为了提升短时语音特征的建模能力,我们扩展其通道维度,但此举会显著增加模型的参数量和计算复杂度。为此,我们提出了ERes2NetV2模型,采用自底向上的双阶段特征融合以及类似瓶颈的特征融合策略,有效降低了模型的参数量和计算成本。我们在公开的英文数据集VoxCeleb和中文数据集3D-Speaker上进行了大量实验,验证方法的有效性和鲁棒性。

论文:https://arxiv.org/pdf/2406.02167

源代码:https://github.com/modelscope/3D-Speaker


Personality-memory Gated Adaptation: An Efficient Speaker Adaptation for Personalized End-to-end Automatic Speech Recognition

论文作者:Yue Gu, Zhihao Du, Shiliang Zhang, Jiqing Han, Yongjun He

论文单位:哈尔滨工业大学,阿里巴巴集团
核心内容:在实际应用中,理想的个性化语音识别模型应同时具备个性化识别能力和通用识别能力。说话人自适应方法常用于个性化ASR模型的训练,然而大部分说话人自适应方法致力于提升模型对于目标说话人的识别能力而忽视甚至牺牲了泛化能力。本文,我们提出的基于门的个性化记忆自适应方法(Personality-memory Gated Adaptation, PGA)可以将模型自适应到目标说话人,并且保留模型原本的泛化能力。具体来说,我们将parallel adapter引入encoder来捕捉目标说话人的声学特性,adapter的输出和原来encoder layer的输出通过一个常量门复合,常量门表示样本和个性化记忆单元的声学相似性。通过这种方式,adapter记忆了目标说话人的声学特性,而ASR的主干网络保持了泛化能力。实验结果显示,仅需要少量的自适应数据和训练步数,PGA就可以在目标域实现21.62%的相对CER下降,而源域性能轻微变差。


CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation

论文作者:Weixiang Yan, Haitian Liu, Yunkun Wang, Yunzhe Li, Qian Chen, Wen Wang, Tingyu Lin, Weishan Zhao, Li Zhu, Hari Sundaram, Shuiguang Deng
论文单位:加利福尼亚大学圣塔芭芭拉分校,西安交通大学,浙江大学,伊利诺伊大学厄巴纳-香槟分校,阿里巴巴集团,维也纳工业大学,中国科学院大学
核心内容:大型语言模型(LLMs)在辅助人类编程和促进编程自动化方面表现出色。然而,现有用于评估LLMs代码理解和生成能力的基准存在严重的局限性。首先,大多数基准测试过于狭隘,专注于少数流行编程语言和特定任务,而实际软件开发场景需要系统在多语言和多任务编程环境中运行以满足多样化的需求。其次,大多数基准测试未考虑生成代码的实际可执行性和执行结果的一致性。

为了弥补现有基准与实际应用期望之间的差距,我们引入了CodeScope,这是一个基于执行、支持多语言、多任务、多维度的评估基准,用于综合评估LLMs的编码任务能力。CodeScope覆盖43种编程语言和八种编码任务,从长度、难度和效率三个维度评估LLMs的编码性能。为了简化基于执行的代码生成评估,我们开发了MultiCodeEngine,这是一种支持14种编程语言的自动化代码执行引擎。最后,我们系统地评估和分析了八个主流LLMs,并展示了CodeScope在评估LLMs代码理解和生成任务方面的广度和挑战性优于其他基准测试。



论文:https://arxiv.org/abs/2311.08588

项目开源地址:https://github.com/WeixiangYAN/CodeScope


Towards Audio Codec-based Speech Separation

论文作者:Jia Qi Yip, Shengkui Zhao, Dianwen Ng, Eng Siong Chng, Bin Ma
论文单位:南洋理工大学,阿里巴巴集团

核心内容:近期,神经音频编解码器(NAC)模型的进展引发了人们对于采用预训练编解码器的浓厚兴趣,这主要用于各类语音处理应用,目的是借助高压缩比带来的效率提升。然而,这些技术尚未被应用于语音分离(SS)任务。由于传统的SS模型需要大量计算资源,这在许多边缘计算场景中显得不实际,因此SS能从高压缩中受益。但SS任务涉及波形掩码,压缩过程中容易引入失真,这会严重影响性能。针对这一问题,我们提出了一个新颖的基于音频编解码的SS任务模型,即在NAC的嵌入空间内进行SS,并开发了一个名为Codecformer的新模型来执行此任务。在推断阶段,Codecformer实现了高达52倍的MAC减少,同时提供的分离性能与云部署的Sepformer相当,为实际应用中高效进行SS提供了新的方向。



Incorporating Class-based Language Model for Named Entity Recognition in Factorized Neural Transducer
论文作者:Peng Wang, Yifan Yang, Zheng Liang, Tian Tan, Shiliang Zhang, Xie Chen

论文单位:上海交通大学,阿里巴巴集团

核心内容:尽管端到端 (E2E) 模型在语音识别方面取得了显著进展,命名实体识别 (NER) 依然是一个具有挑战性却对语义理解至关重要的问题。以往的研究主要集中在各种基于规则或基于注意力的上下文偏置算法。然而,这些算法的性能可能会对偏置权重敏感,或者由于过度关注命名实体列表而下降,并且存在误触发的风险。受到传统混合系统中基于类别的语言模型 (LM) 在命名实体识别中取得的成功以及因子化神经 Transducer (FNT) 在有效解耦声学和语言信息方面的启发,我们提出了一种新的端到端模型C-FNT,它将基于类别的语言模型融入 FNT。在 C-FNT 中,命名实体的语言模型得分可以与类别名称相关联,而不是其表面形式。实验结果表明,我们提出的 C-FNT 显著减少了命名实体识别中的错误,同时不损害一般词汇识别的性能。


论文:https://arxiv.org/abs/2309.07648

MaLa-ASR: Multimedia-Assisted LLM-Based ASR

论文作者:Guanrou yang,Ziyang Ma,Fan Yu, Zhifu Gao, Shiliang Zhang, Xie chen

论文单位:上海交通大学,阿里巴巴集团

核心内容:随着视频等信息丰富的数据越来越多,利用多模态辅助信息来增强音频任务引发了广泛的研究兴趣。最近,基于 LLM 的音频模型的研究热潮为解决音频任务提供了新的视角。鉴于 LLM 可以灵活地接收多种输入,我们提出了MaLa-ASR,这是一种基于 LLM 的 ASR 模型,可以整合从演示幻灯片中提取的文本关键词,从而提高会议内容的识别准确率。在 SlideSpeech 语料库的 L95 和 S95 子集中,MaLa-ASR 的平均词错误率分别为 9.4% 和 11.7%,与 SlideSpeech 中报告的基线模型相比,词错误率分别大幅下降了 27.9% 和 44.7%。MaLa-ASR 展现了 LLM 在语音任务中的强大性能以及方便整合辅助信息的能力。通过在输入提示中添加关键词,偏置词错误率(B-WER)相对降低了 46.0% 和 44.2%,在该数据集上建立了新的 SOTA。

核心内容:本文提出emotion2vec,一种通用的语音情感表征模型。emotion2vec通过自监督在线蒸馏在开源无标签情感数据上进行预训练,在预训练期间结合了句级损失和帧级损失。在主流的IEMOCAP数据集上,emotion2vec仅为语音情感识别任务训练线性层,表现优于最先进的预训练通用模型和情感专家模型。此外,emotion2vec在10个不同语言的语音情感识别数据集上均显示出一致的提升效果。emotion2vec在其他情感任务上也显示出优异的结果,如歌曲情感识别、对话中的情感预测和情绪分析。对比实验、消融实验和可视化全面证明了emotion2vec的通用性。据我们所知,emotion2vec是情感相关任务中的第一个通用表征模型,填补了该领域的空白。

论文:https://arxiv.org/abs/2312.15185

源代码:https://github.com/ddlBoJack/emotion2vec