INTERSPEECH 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 INTERSPEECH 2023 录用论文的作者进行报告交流。

INTERSPEECH 2023 论文预讲会第六期邀请到上海交通大学X-LANCE跨媒体语言智能实验室在7月5日做专场分享,欢迎大家预约观看。


本次预讲会是由上海交通大学X-LANCE跨媒体语言智能实验室做专场分享,上海交通大学计算机科学与工程系长聘教轨副教授 —— 陈谐进行主持。

下面是预讲会的回顾:

马子阳

论文题目:Pushing the Limits of Unsupervised Unit Discovery for SSL Speech Representation
作者:Ziyang Ma, Zhisheng Zheng, Guanrou Yang, Yu Wang, Chao Zhang, Xie Chen

摘要:语音自监督大模型的优秀泛化能力已经获得了极大的关注。HuBERT是一个成功的例子,它利用离线聚类将语音特征转换为离散的单元,用于掩码语言模型建模的代理任务。然而,简单地以k-means为目标对特征进行聚类并不能完全激发模型的性能。在这项工作中,我们提出了一种无监督的方法来改进SSL目标。我们提出了两个模型,MonoBERT和PolyBERT,它们分别利用与上下文无关的和基于上下文的音素单元进行预训练。我们的模型在LibriSpeech基线上的表现明显优于其他SSL模型,并且不需要迭代的重新聚类和重新训练。进一步地,PolyBERT甚至超过了在预训练期间使用有标注数据的模型。我们还验证了模型在非ASR语音任务上的效果。实验展示了我们的目标探索过程如何逐步提升模型性能。


梁正

论文题目:Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation 
作者:Zheng Liang, Zheshu Song, Ziyang Ma, Chenpeng Du, Kai Yu , Xie Chen
摘要:对于端到端语音识别(E2E ASR),语码转换(code-switching)识别和命名实体识别仍是两个具有挑战性的任务,其中相关数据的稀缺是两种任务性能较差的原因之一。数据增广技术能够有效地提升ASR的性能,对于语音数据的增广,常用的方法为语音拼接和语音合成(TTS),但这两种方法生成的语音数据通常在声学特征上不连续或不真实,从而影响ASR的性能。为了缓解这些问题,我们在基于文本的语音编辑模型的基础上提出了一种新的语音数据增广方法。在本文中,我们构建了基于文本的语音编辑模型,其能够通过”编辑“原始语音来有效地生成高质量、高连续性和较为真实的code-switching和含有命名实体的语音音频。在两种任务上的实验也表明我们所提出的数据增广方法有效地提升了ASR模型的性能。

刘森

论文题目:DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech 
作者:Sen Liu, Yiwei Guo, Chenpeng Du, Xie Chen, Kai Yu
摘要:主流的多语种语音合成模型很难在跨语言合成时既能保持说话人音色,又能消除说话人受其母语影响而产生的口音问题。本文在基于向量量化声学特征的语音合成模型基础上,提出了一种双说话人嵌入方法,在跨语种语音合成任务上取得了显著效果。

谢泽宇

论文题目:Enhance Temporal Relations in Audio Captioning with Sound Event Detection
作者:Zeyu Xie, Xuenan Xu, Mengyue Wu, Kai Yu
摘要:自动音频摘要生成任务(AAC)旨在为给定的音频片段生成自然语言描述,不仅要检测和分类声音,还要总结音频事件之间的关系。近期在AAC方面的研究进展引入了额外的指导信息,以提高生成句子中音频事件的准确性。然而,在揭示复杂关系方面,如音频事件之间的时间关系却受到了很少的关注,而揭示复杂关系是总结音频内容的关键组成部分。因此,本文旨在通过声音事件检测(SED)这一任务来更好地捕捉摘要生成中的时间关系,该任务定位事件的时间戳。我们研究了在生成模型中整合时间信息的最佳方法,并提出了一种时间标记系统,将时间戳转化为可理解的关系。通过所提出的时间度量评估的结果表明,在时间关系生成方面取得了显著的改进。


李广鹏

论文题目:How ChatGPT is Robust for Spoken Language Understanding? 
作者:Guangpeng Li, Lu Chen, Kai Yu
摘要:大型语言模型(LLMs),例如ChatGPT,在各种NLP任务上表现出超强的性能。   然而,这些在大型的书面文本语料库上训练的LLMs是否能表现出理解口语文本的鲁棒性依然没有一个确切的结论。   因此,在本文中,我们对ChatGPT的鲁棒性口语理解(SLU)进行了详细研究。在我们的实验中,我们在两组公共数据集上评估了ChatGPT,即SQuAD和ASR-GLUE,其中的文本中存在着ASR错误。  对实验结果进行的定量和定性分析表明,ChatGPT不仅在SLU任务中表现非常好,而且还能以其超级推理能力免受一些ASR错误的影响。


论文征集
INTERSPEECH 2023 论文预讲会面向全球线上招募,结合定向邀请与自选投稿的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 INTERSPEECH 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。


投稿方式

投稿邮箱:jack@speechhome.com


联系人微信