
本期沙龙由上海交通大学计算机科学与工程系教授,博士生导师,国家优秀青年基金获得者—钱彦旻主持。
下面是沙龙的回顾:
杨 磊
目标说话人提取任务是从多个说话人的混合语音中提取目标说话人的声音。该技术可应用于语音通话、视频会议、视频编辑、会议纪要、目标人语音提取等场景。使用该技术时需要提前注册目标说话人的语音,但是在实际应用中,注册时的语音过长会降低用户使用的积极性。因此,研究超短注册时间的目标说话人提取技术是必要的。对此,三星电子中国研究院的音频算法团队提出了一种新的VE-VE框架来支持超短注册语音,本次分享围绕该技术进行介绍。
徐 亮
声音事件检测已经应用到了消费、医疗、工业中,为计算机、嵌入式设备与外界的智能交互提供了技术支撑。在当前,由于相关数据标签的标注困难,以及目标事件本身容易被外界噪声所掩盖,声音事件检测仍然存在不小的挑战。而预训练网络所提取的深层特征能够提供更丰富、更泛化的特征,为声音事件检测带来新的可能。本次分享围绕半监督的声音事件检测任务,加入预训练网络特征,进一步提高声音事件检测的准确度。
庄毅萌
掩码语言模型预训练提供了一种学习上下文语义表征的标准化方法,该方法通过估计给定上下文的随机掩码词元的条件概率来重建损坏的文本序列。我们试图利用模型本身的语言知识,以轻量级和动态的方式增强其预训练。我们研究了一种启发式的词元掩码方案,其中深度网络和浅层网络预测不一致的词元更有可能被掩码。该方法可应用于掩码语言模型预训练中,同时保证训练效果和效率。实验表明,用启发式掩码方案预训练的掩码语言模型在各种下游任务中优于先前的方案。
温 亮
视频是用户感知、记录、传播和接收的重要媒体形式,涉及日常录像、视频通话到专业影视节目制作等多种应用领域,需要满足多样性的质量和传输需求。随着视频的分辨率以及帧率的提升,视频压缩的需求也越来越迫切。视频编码通过对视频帧(采用)预测、变换、滤波等工具对视频数据进行压缩以满足用户存储和传输需求。随着人工智能与神经网络技术的发展,基于神经网络的视频编码成为火热的研究方向。本次分享介绍三星电子中国研究院在视频编码中的帧间预测工具中采用神经网络方法的探索工作。
武金婷
近年来,借助可穿戴设备采集的生理信号和日常行为进行运动追踪和健康监测已成为各大科研机构和厂商的研究热点。然而,利用生理信号推断心理状态和精神疾病的研究仍在探索中。其中难点之一在于用户的日常行为习惯和生理表征不同,信号存在很大的个体偏差,进而影响健康相关功能的准确性和鲁棒性。ICASSP 2023 E-Prevention(Person Identification and Relapse Detection from Continuous Recordings of Biosignals)竞赛提供了一个包含长期连续生物信号记录的数据集,试图通过挖掘用户数据中的个体差异性和独特性来解决这个问题。三星电子中国研究院参与了该竞赛 Track 1 (即识别智能手表的佩戴者)的角逐,并获得了第一名。本次分享围绕该用户身份识别系统展开介绍。
至此,本期沙龙圆满结束。语音之家将持续为大家带来干货满满的技术分享,敬请关注!
