今日论文合集:CS.SD语音与音频 | 共 18 篇


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准

快速导航

1. 语音识别与关键词检测 2 篇

2. 说话人识别、验证与分离 1 篇

3. 音频事件检测与场景理解 4 篇

4. 音乐信息检索与音乐生成 1 篇

5. 低资源、多语言与方言语音 1 篇

6. 数据集、基准与评测 3 篇

7. 安全、隐私与深度伪造音频 3 篇

8. 其他/综合语音音频 3 篇

1. 语音识别与关键词检测 | 2 篇

1. Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

倾听、思考、转录:用于自动语音识别的连续潜在测试时间缩放

AI 总结:提出LatentASR方法,通过两个可训练模块在冻结的ASR主干上添加连续潜在测试时间缩放,在极小数据量下降低词错误率,动态停止可节省计算量,还能在多语言中泛化。

链接:https://arxiv.org/abs/2607.05051

作者:Ho Lam Chung, Yiming Chen, Dau-Cheng Lyu, Hsiao-Tsung Hung, Hung-yi Lee

2. Context-Aware ASR for Mandarin Technical Lectures

用于汉语技术讲座的上下文感知自动语音识别

AI 总结:研究汉语技术讲座中上下文对英文术语识别的作用,构建基准并定义以术语为中心的指标,提出两阶段无参考解码方法,提升术语召回率并降低字符错误率。

链接:https://arxiv.org/abs/2607.05058

作者:Ho-Lam Chung, Yiming Chen, Hung-yi Lee

2. 说话人识别、验证与分离 | 1 篇

3. Towards Robust Uncertainty-Aware Speaker Modeling

迈向稳健的不确定性感知说话人建模

AI 总结:研究针对说话人嵌入的不确定性估计及校准问题,提出稳健不确定性建模框架。核心方法是结合说话人间可分性与说话人内变异性的不确定性Softmax及不确定性校准域适应框架。贡献是提升不确定性可靠性与说话人识别稳健性。

链接:https://arxiv.org/abs/2607.04937

作者:Junjie Li, Yang Xiao, Kong Aik Lee

3. 音频事件检测与场景理解 | 4 篇

4. Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types

用于鸟类物种和叫声类型多任务生物声学分类的自适应损失平衡

AI 总结:研究被动声学监测中鸟类发声模型,扩展BirdCallNet用于长尾WiWa数据集的联合分类,评估四种鸟类领域编码器,比较不同损失平衡方法,发现最佳策略依主干、适应方式和目标任务而定。

链接:https://arxiv.org/abs/2607.03304

机构:Kiel University(基尔大学)

作者:Paria Vali Zadeh, Sven Tomforde

5. Trajectory Variance: AnUnsupervised Measure of Developmental Vocal Plasticity in Birdsong

轨迹方差:鸟类鸣叫发育中无监督的发声可塑性度量

AI 总结:研究鸟类鸣叫发育中发声变化,提出轨迹方差这一可塑性得分,用位移模型预测自动编码器潜在空间中年龄条件变化,其预测方差量化发声变化,能区分习得音节与先天鸣叫且与频谱平坦度相关。

链接:https://arxiv.org/abs/2607.03496

机构:Institute of Neuroinformatics, University of Zurich and ETH Zurich(苏黎世大学和瑞士联邦理工学院神经信息学研究所)

作者:Kanghwi Lee

6. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

Auto-AEG:用于开放词汇音频事件定位的可扩展数据构建

AI 总结:研究开放词汇音频事件定位任务,因数据稀缺受限。提出Auto-AEG可扩展管道,通过自动数据构建和模型微调构建监督,结合合成音频与伪标签训练,提升模型性能。

链接:https://arxiv.org/abs/2607.04383

作者:Zihan Zhang, Xize Cheng, Wenhao Yan, Tong Zhang, Dongjie Fu, Boyun Zhang, Yongbo He, Tao Jin

7. Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection

用于首次异常声音检测的无训练模型选择和域感知分数校准

AI 总结:针对DCASE挑战任务2中首次异常声音检测问题,提出无训练事后层,通过每域分位数校准和无标签交叉验证域平衡标准解决相关问题,提升评估分数。

链接:https://arxiv.org/abs/2607.04526

作者:Grach Mkrtchian

4. 音乐信息检索与音乐生成 | 1 篇

8. Taste-aware music retrieval from audio embeddings

从音频嵌入中进行味觉感知音乐检索

AI 总结:将基于内容的音乐信息检索基准形式化,通过共享多任务回归头比较四个HEAR家族的十个音频编码器,采用门控后期融合,计算绝对误差和等级相关性以评估模型有效性,预测味觉空间效果优于基线。

链接:https://arxiv.org/abs/2607.03296

作者:Matteo Spanio, Antonio Rodà

5. 低资源、多语言与方言语音 | 1 篇

9. TokAN: Accent Normalization Using Self-Supervised Speech Tokens

TokAN:使用自监督语音令牌进行口音归一化

AI 总结:研究提出TokAN框架,基于自监督离散语音令牌,用自回归编解码器转换口音,引入强化学习后训练,还用流匹配合成器和持续时间预测器,实验表明其在降低字错误率和提升可懂度上优于基线。

链接:https://arxiv.org/abs/2607.03928

机构:School of Data Science (SDS), The Chinese University of Hong Kong, Shenzhen (CUHKSZ)(香港中文大学(深圳)数据科学学院); Tencent Ethereal Audio Lab, Tencent(腾讯虚幻音频实验室); School of Intelligence Science and Technology, Nanjing University, Suzhou(南京大学苏州校区智能科学与技术学院); Shenzhen Loop Area Institute(深圳环区研究院); X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室); School of Artificial Intelligence (SAI), CUHKSZ(香港中文大学(深圳)人工智能学院); Shenzhen Research Institute of Big Data(深圳大数据研究院)

作者:Qibing Bai, Shuai Wang, Yuhan Du, Bohan Li, Yannan Wang, Haizhou Li

6. 数据集、基准与评测 | 3 篇

10. Doppelganger: Sound Effects and Their Synthetic Twins

分身:音效及其合成孪生体

AI 总结:介绍Doppelganger基准,用于跨合成-真实边界匹配音效。通过配对真实与合成音频,测试不同训练方式对音频编码器跨边界匹配的影响,发现特定训练可提升匹配准确率,且该匹配具有生成器特异性。

链接:https://arxiv.org/abs/2607.04337

机构:ETH Zürich(苏黎世联邦理工学院)

作者:Elliott Ash

11. Sampling Bias Compensation for Robust Evaluation of Audio Classification Systems with Partially Labeled Evaluation Datasets

用于对具有部分标记评估数据集的音频分类系统进行稳健评估的采样偏差补偿

AI 总结:研究在严格标注预算约束下补偿评估标记子集偏差的方法,通过实现并比较三种密度比估计方法,利用主动学习技术生成标记子集进行实验,表明重要性加权能给出更现实准确度估计。

链接:https://arxiv.org/abs/2607.04463

作者:Javier Naranjo-Alcazar, Annamaria Mesaros, Tuomas Virtanen, Pedro Zuccarello

12. Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification

用于生物声学事件分类的具有冗余控制的自适应多样性-不确定性主动学习

AI 总结:针对大规模生物声学监测中专家标注昂贵且数据分布不均问题,提出主动学习策略,联合建模预测不确定性、嵌入空间多样性和批内冗余,用自适应加权和贪心MMR程序提升标注效率。

链接:https://arxiv.org/abs/2607.04868

作者:Gabriel Dubus, Hugo Magaldi, Anatole Gros-Martial

7. 安全、隐私与深度伪造音频 | 3 篇

13. DETECT-3B-Omni is Agnostic of Content and Demographics

DETECT-3B-Omni对内容和人口统计学特征不敏感

AI 总结:研究Resemble AI的DETECT-3B-Omni检测器语义独立性,用来自不同AI语音克隆系统的多样音频样本测试,通过等价测试表明其检测准确率不受语音内容、说话者性别、年龄和地区影响。

链接:https://arxiv.org/abs/2607.03418

机构:Resemble AI(相似人工智能公司); Deutsche Telekom(德国电信公司)

作者:Nicolas M. Müller, Aditya Tirumala Bukkapatnam, Dominik Schnieders, Zohaib Ahmed

14. Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)

信息几何叠加元音评估:第1部分。音节文字(日语)

AI 总结:以日语为例,通过分析语音频谱分布,利用瓦瑟斯坦度量评估频谱距离,结合持久同调进行拓扑映射,来区分生成式人工智能合成的虚假人类语音和自然语音。

链接:https://arxiv.org/abs/2607.04154

作者:Yusei Tamura, Shigekazu Ishihara, Ken Ito

15. SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation

SynSFX:用于深度伪造检测和评估的多模型音效合成数据集

AI 总结:研究音频深度伪造检测中合成音效泛化问题,通过创建涵盖7种文本到音频模型的SynSFX数据集支持该研究方向。

链接:https://arxiv.org/abs/2607.04848

作者:Linxi Li, Yuncong Yu, Qianwei Guo, Liwei Jin, Yechen Wang, Carsten Maple

8. 其他/综合语音音频 | 3 篇

16. Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

节拍器:限制缓存,为实时交互模型服务保持节奏

AI 总结:研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。

链接:https://arxiv.org/abs/2607.02640

机构:Pine AI(松果人工智能公司)

作者:Jiaying Meng, Bojie Li

17. EEG-Based Imagined Speech Decoding Using a Hybrid CNN-SNN Architecture

基于脑电图的想象语音解码:使用混合卷积神经网络-脉冲神经网络架构

AI 总结:研究针对脑电图信号想象语音解码难题,提出用卷积神经网络提取时间表征,再经脉冲神经网络进行生物启发式时间分类的混合解码方法,在基准测试中取得高准确率,证明该方法有效性。

链接:https://arxiv.org/abs/2607.03844

机构:Doctoral School of Science, Technology, and Engineering, University of Granada(格拉纳达大学科学、技术与工程博士学院); University of Technology Belfort-Montbéliard, SINERGIES(贝尔福-蒙贝利亚尔技术大学,协同实验室); Department of Signal Theory, Telematics and Communications, University of Granada(格拉纳达大学信号理论、电信与通信系); Department of Chemical Engineering, Stanford University(斯坦福大学化学工程系); Department of Electrical and Computer Engineering, Aarhus University(奥尔胡斯大学电气与计算机工程系)

作者:Fatima Shalhoub, Mariam Al Mawla, Kabalan Chaccour, Iván López-Espejo, Hoda Fares

18. CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

CARD:用于无编码器音频字幕的跨组件音频表示蒸馏

AI 总结:研究提出无编码器音频字幕模型CARD,去除推理时的编码器,用含合并LoRA适配器的投影仪给冻结的语言模型供能。通过跨组件蒸馏预训练音频教师模型,提升了CIDEr-D指标。

链接:https://arxiv.org/abs/2607.04619

作者:Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis, Ravi Shekhar