ICASSP 2024 论文预讲会由CCF语音对话与听觉专委会、语音之家主办,旨在为学者们提供更多的交流机会,更方便、快捷地了解领域前沿。活动将邀请 ICASSP 2024 录用论文的作者进行报告交流。
ICASSP 2024 论文预讲会第八期邀请到哈尔滨工程大学做本次会议的专场分享,欢迎大家观看。

实验室概况

哈尔滨工程大学智能信号处理组(Group of Intelligent Signal Processing, GISP@HEU),由计算机科学与技术学院关键老师成立于2020年。GISP实验室音频方向主要研究内容包括声音识别与分类、工业异音检测、跨模态音频内容理解与检索、音效生成等。

第八期

哈尔滨工程大学【专场】

时间:3月15日(周五)19:00 ~ 20:30

形式:线上

议程:每位嘉宾分享30分钟(含5分钟QA)



嘉宾&主题


嘉宾简介:肖飞扬,哈尔滨工程大学计算机学院2023级博士研究生,研究方向为跨模态音频内容理解,研究内容为自动音频字幕与检索。在IEEE SPL,ICASSP, INTERSPEECH等期刊会议发表学术论文7篇,其参赛系统获得DCASE 2022任务6A第6名,DCASE 2023任务6A第6名,任务6B第四名。

分享主题:Graph Attention for Automated Audio Captioning

摘要:自动音频字幕是一项跨模态音频内容理解任务,旨在通过自然语言描述音频信号蕴含信息,使机器具备理解表达音频场景事件语意内容的能力。现有的主流自动音频字幕方法几乎均采用大规模音频预训练模型(如:PANNs)进行音频特征表示,借助其音频事件分析能力,提升自动音频字幕性能。但PANNs模型受限于所采用的卷积计算机制,缺乏对音频特征时序上下文关系的建模能力,导致现有主流方法的性能受限。为此,本文提出了一种基于图注意力机制的自动音频字幕方法(GraphAC),所提方法通过构建音频节点邻接图,实现音频信号中的时序上下文信息关系建模,并通过top-k掩码机制过滤与音频场景内容无关信息,由此强化与音频场景事件相关的上下文语意关联,进而提高音频描述的准确性和流畅性。实验结果表明,GraphAC在自动音频字幕任务上获得了优于现有的基于PANNs音频编码器的主流方法的性能表现,由此验证了图注意力机制在捕获音频时序上下文信息的有效性。本文方法所构建集成系统在DCASE 2022 Challenge自动音频字幕赛道(Task 6A)取得了国际第6名。



嘉宾简介:张合静,哈尔滨工程大学智能信号处理组2023级硕士研究生,研究方向为声学场景事件分类及检测,研究内容为异常声音检测。在ICASSP,INTERSPEECH发表论文2篇,合作参赛系统获得DCASE 2023任务2第七名。
分享主题:First-Shot Unsupervised Anomalous Sound Detection with Unknown Anomalies Estimated by Meta
摘要:针对DCASE 2023 Challenge Task2提出的全新任务——First-shot (FS) unsupervised anomalous sound detection (ASD)中目标机器类型的异常声音未被提供的无监督学习问题,本文提出了一个利用元数据辅助生成机器声音来估计未知机器类型的异常从而解决First-Shot无监督异常声音检测任务的新框架,即利用可用的机器信息(即元数据和音频数据)来构建生成模型学习元数据信息与机器声音的联系,借助元数据生成包含未知机器类型的独特声学特征的异常声音,从而解决ASD中的无监督学习问题。为了验证所提框架的有效性,本文所提框架基于TWFR-GMM模型构建了FS-TWFR-GMM方法,FS-TWFR-GMM方法以较少的模型参数在DCASE 2023 Challenge Task2数据集的异常检测阶段取得了优异成绩。此外,本工作也是第一个提出利用设备属性信息生成设备音频进行异常声音检测的工作,为异常声音检测任务提供了新的解决方案。


嘉宾简介:田健通,哈尔滨工程大学计算机学院2022级硕士研究生,研究方向为声学场景事件分类及检测,研究内容为异常声音检测。异音检测研究工作合作发表EURASIP JASMP,ICASSP论文2篇,参赛系统获得DCASE 2023任务2第七名。
分享主题:Hierarchical Metadata Information Constrained Self-Supervised Learning for Anomalous Sound Detection under Domain Shift

摘要:自监督学习被广泛应用于解决异常声音检测(ASD)任务中的域迁移问题,常用方法通过在特征学习中结合设备ID来学习特征差异性,以区分正常和异常声音。然而该类处理方法并未考虑导致域迁移问题的属性信息(机器工况和噪声类型等)差异,导致性能受限。为此,本文提出了一种层级约束的自监督学习异常声音检测方法(HMIC),构建了设备ID与属性之间的层级关系,并将其作为约束条件,以实现更精细、更丰富的特征表示。此外,本文还提出了一种基于属性组中心(AGC)的异常分数计算方法,用于计算域偏移条件下的异常分数,以降低属性信息差异的影响。实验表明,本文提出的基于层级约束音频表示方法优于DCASE 2022挑战任务2上最先进方法。


参与方式

直播将通过语音之家微信视频号进行直播

手机端、PC端可同步观看
👇👇👇


讨论群

扫码添加语音小管家,进入语音之家讨论群


预讲论文征集
ICASSP 2024 论文预讲会面向全球线上招募,结合定向邀请与征集报名的方式,来选择预讲会的嘉宾。


为了共创高质量的论文预讲会,我们诚挚邀请所有 ICASSP 2024 作者参与到此次预讲会活动中来,也欢迎大家推荐适合此次预讲会活动的学者。


预讲论文报名方式

联系人邮箱

bd@speechhome.com


联系人微信