ICASSP 2023 论文预讲会是由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2023 录用论文的作者进行报告交流。
ICASSP 2023 论文预讲会邀请到西北工业大学音频语音与语言处理研究组(NPU-ASLP)在5月23日、5月24日分别做两期专场分享,本文介绍第一场相关内容,欢迎大家预约观看。
实验室概况
西北工业大学音频语音与语言处理研究组(ASLP@NPU)依托于空天地海一体化大数据应用技术国家工程实验室和陕西省语音与图像信息处理重点实验室。研究组成立于1995年,经过近20多年的快速发展,已形成了人机语音交互、语音与音频信号处理、音视频多模态信息处理、多媒体内容分析、机器学习等主要研究方向。研究组与比利时、英国、美国、新加坡等多所高校与研究机构建立了长期合作关系,同时,实验室与工业界联系密切,目前已经与华为、腾讯、微软、阿里巴巴、小米、网易、字节跳动、美团、爱奇艺、网易、出门问问等行业头部企业与初创公司开展了广泛深入的科研合作,众多研究成果已经在实际产品中获得应用,获得华为技术合作奖、美团科研合作奖等。实验室在领域顶级期刊和会议上发表学术论文300余篇,在多个重要会议上获得多篇优秀论文奖,参加多个国际国内技术评测获得第一名,取得了丰硕的研究成果。实验室入选2019《互联网周刊》十大顶尖高校人工智能实验室。

魏坤
分享主题:利用语音和双语文本联合预训练的语音到语音翻译模型
摘要:与级联语音到语音翻译任务(S2ST)相比,端到端语音到语音翻译具有诸多优点,是当前的热点研究课题。然而,端到端S2ST存在数据稀缺问题,因为从源语言语音到目标语言语音的语料库非常稀少。为了解决这个问题,本文中提出了一个Speech2S模型,该模型使用未配对语音和双语文本数据进行联合预训练,用于端到端语音到语音翻译任务。通过有效利用双语的翻译文本数据,Speech2S能够建模从源语言到目标语言的跨语言语音的翻译。我们在Europarl-ST和VoxPopuli数据集上验证了所提出的Speech2S模型的性能。实验结果表明,与仅使用编码器预训练的语音到语音翻译模型相比,Speech2S获得了约5个BLEU分数的提升,并实现了与现有最先进模型相比具有竞争力甚至更好的性能。
闫晓鹏
摘要:本文介绍了西工大-大象声科联合提交的的个性化语音增强系统 (NAPSE),该系统参加了 ICASSP 2023 第五届深度噪声抑制挑战赛(DNS Challenge)。该方案基于两阶段模型 TEA-PSE 2.0,探索了更好的说话人嵌入融合方式,优化了模型训练策略,并引入了对抗训练和多尺度损失。根据官方结果,该系统在耳机赛道(赛道 1)中排名第一(并列),在扬声麦克风赛道(赛道 2)中排名第二。
张奥

为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2023 作者参与到会议中来,也欢迎大家推荐适此会议论文分享的学者。
投稿邮箱
jack@speechhome.com
联系人微信

