今日论文合集:cs.SD语音22篇,eess.AS音频处理31篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation
标题:F3-Tokenizer:驯服音频自动编码器的理解和生成潜力
链接:https://arxiv.org/abs/2606.06357
作者:Dinghao Zhou, Xingchen Song, Di Wu, Pengyu Cheng, Shengfan Shen, Sixiang Lv
备注:Technical report; early work; 9 pages, 2 figures, 5 tables


【2】FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition

标题:基于FiLM的语音说话人条件反射LLM用于病理性语音识别
链接:https://arxiv.org/abs/2606.06211
作者:Fernando López, Santosh Kesiraju, Jordi Luque
备注:Accepted in Odyssey 2026: The Speaker and Language Recognition Workshop


【3】Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition

标题:Zero-Shot跨语言语音情感识别的描述区分表示
链接:https://arxiv.org/abs/2606.06200
作者:Jinyi Mi, Ding Ma, Tomoki Toda
备注:Accepted to Interspeech 2026


【4】Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

标题:多任务学习还不够:双输出第二语言语音识别中的代表性纠缠
链接:https://arxiv.org/abs/2606.06065
作者:Seung Hwan Cho, Young-Min Kim
备注:5 pages, 2 figures, Accepted to the 43rd International Conference on Machine Learning Workshop on Machine Learning for Audio


【5】SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

标题:SpeechJBB:探索代码交换语音下大型音频语言模型的安全一致和理解
链接:https://arxiv.org/abs/2606.06037
作者:Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani


【6】DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement

标题:DBHN-Net:用于低复杂度单耳语音增强的双分支混合神经网络
链接:https://arxiv.org/abs/2606.05911
作者:Cunhang Fan, Enrui Liu, Jing Zhou, Jian Kang, Jie Li, Andong Li, Jian Zhou, Zhao Lv, Xuelong Li
备注:This article has been accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)


【7】Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

标题:超越WER:环境临床抄写员的配对声学压力测试
链接:https://arxiv.org/abs/2606.05909
作者:Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang, Yang Ai, Zhen-Hua Ling, Lei Jiang, Zhi-Yang He
备注:Accepted to INTERSPEECH 2026


【8】GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech

标题:GLASS:接受GRPO训练的LoRA,用于Zero-Shot文本到语音中的声学风格引导
链接:https://arxiv.org/abs/2606.05889
作者:Jaehoon Kang, Yejin Lee, Kyuhong Shim


【9】UniVoice: A Unified Model for Speech and Singing Voice Generation

标题:UniVoice:语音和歌声生成的统一模型
链接:https://arxiv.org/abs/2606.05852
作者:Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen
备注:9 pages, 2 figures


【10】SagnacAssisted Enhanced OTDR for Distributed Acoustic Sensing: A Standardized Benchmark and Engineering Evaluation Framework

标题:用于分布式声学传感的Sagnac辅助增强型TLR:标准化基准和工程评估框架
链接:https://arxiv.org/abs/2606.05754
作者:Weiguang Wang, Fugen Wu, Hailing Wang, Xuechen Liang, Xiaobin Li, Ru Han, Tianchang Xie


【11】Do speech foundation models perceive speaker similarity as humans do?

标题:语音基础模型是否像人类一样感知说话者的相似性?
链接:https://arxiv.org/abs/2606.05739
作者:Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi, Yuki Saito
备注:Accepted by INTERSPEECH 2026


【12】Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

标题:超越生成解码:用于多模式情绪分析的本地全模式LLM的区分性隐藏状态读出
链接:https://arxiv.org/abs/2606.05713
作者:Bin Wen, Tien-Ping Tan
备注:18 pages, 4 figures, 6 tables


【13】Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition

标题:超越波形鲁棒性:对自动语音识别的鲁棒性干扰声码器对抗攻击
链接:https://arxiv.org/abs/2606.05678
作者:Yifan Liao, Zongmin Zhang, Zhen Sun, Yuhui Sun, Xinhu Zheng, Xinlei He
备注:11 pages


【14】SB-RF: Schrödinger Bridge Rectified Flow for One-Step Robust Speech Enhancement

标题:SB-RF:用于一步稳健语音增强的薛定汉桥纠正流程
链接:https://arxiv.org/abs/2606.05575
作者:Caixia Lu, Xueyang Lv, Penglong Hu, Jiaming Xu


【15】Sound Effects Dataset Unification With the Universal Category System

标题:音效数据集与通用类别系统的统一
链接:https://arxiv.org/abs/2606.05571
作者:Jun Woo Beck, Alexander Lerch
备注:DAFx 2026 camera-ready version


【16】Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs

标题:使用特定于语言的统计图的领域感知发音错误检测和诊断
链接:https://arxiv.org/abs/2606.05569
作者:Huu Tuong Tu, Hanh Nguyen, Thien Van Luong, Nguyen Tien Cuong, Vu Huan, Nguyen Thi Thu Trang
备注:Accepted at Interspeech 2026


【17】Probing Spatial Structure in Pretrained Audio Representations

标题:探索预训练音频表示中的空间结构
链接:https://arxiv.org/abs/2606.05544
作者:Chuyang Chen, Sivan Ding, Adrian S. Roman, Juan Pablo Bello
备注:Accepted to Interspeech 2026


【18】Exploring LLMs for South Asian Music Understanding and Generation

标题:探索南亚音乐理解和生成的法学硕士
链接:https://arxiv.org/abs/2606.05522
作者:Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sajjad, Santu Karmaker
备注:19 pages, 7 figures


【19】nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies

标题:nnAudio 2:克服动态编译障碍并转变不确定性
链接:https://arxiv.org/abs/2606.05394
作者:Abhinaba Roy, Junyi Liang, Dorien Herremans


【20】Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech

标题:基于语音模型的文本到语音中情绪表达力控制的任务-载体算法
链接:https://arxiv.org/abs/2606.05367
作者:Daniel Oliveira de Brito, Arnaldo Candido Junior
备注:10 pages, 5 figures


【21】USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding

标题:USAD 2.0:通用音频理解的缩放表示蒸馏
链接:https://arxiv.org/abs/2606.06444
作者:Heng-Jui Chang, Alexander H. Liu, Saurabhchand Bhati, Mrudula Athi, Anton Ratnarajah, Amit Chhetri, James Glass
备注:Accepted to Interspeech 2026


【22】M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

标题:M2 S-AVSR:用于鲁棒视听语音识别的模式感知多视图自我监督表示
链接:https://arxiv.org/abs/2606.05763
作者:Fei Su, Cancan Li, Juan Liu, Ming Li
备注:submitted to IEEE Transactions on Audio, Speech, and Language Processing


eess.AS音频处理


【1】USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding
标题:USAD 2.0:通用音频理解的缩放表示蒸馏
链接:https://arxiv.org/abs/2606.06444
作者:Heng-Jui Chang, Alexander H. Liu, Saurabhchand Bhati, Mrudula Athi, Anton Ratnarajah, Amit Chhetri, James Glass
备注:Accepted to Interspeech 2026


【2】Revisiting Lexicon Evaluation in Unsupervised Word Discovery

标题:重新审视无监督单词发现中的词典评估
链接:https://arxiv.org/abs/2606.06183
作者:Simon Malan, Danel Slabbert, Herman Kamper
备注:6 figures


【3】CoSTA: Cognitive-State-Conditioned TTS Data Augmentation Using ASR Transcripts for Alzheimer's Disease Detection

标题:CoSTA:使用SVR转录物增强认知状态条件下的TTC数据以检测阿尔茨海默病
链接:https://arxiv.org/abs/2606.06170
作者:Yin-Long Liu, Yuanchao Li, Yiming Wang, Yue Li, Rui Feng, Jiaxin Chen, Shaobo Liu, Liu He, Yuang Chen, Jiahong Yuan, Zhen-Hua Ling
备注:Accepted by Interspeech 2026


【4】VoCodec: A Low-bitrate Streamable Neural Speech Codec with Voicing-driven Quantization

标题:VoCodec:具有语音驱动量化的低比特率可流传输神经语音编解码器
链接:https://arxiv.org/abs/2606.05892
作者:Xiao-Hang Jiang, Yang Ai, Rui-Chen Zheng, Li-Rong Dai, Zhen-Hua Ling, Ji Wu
备注:Accepted to INTERSPEECH 2026


【5】An Ultra-Low-Bitrate Neural Speech Codec with Plain-to-Pseudo Synergistic Vector Quantization

标题:具有纯伪协同量化的超低比特率神经语音编解码器
链接:https://arxiv.org/abs/2606.05876
作者:Xiao-Hang Jiang, Yang Ai, Fei Liu, Rui-Chen Zheng, Jian-Qing Gao, Zhen-Hua Ling, Ji Wu
备注:Accepted to INTERSPEECH 2026


【6】M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

标题:M2 S-AVSR:用于鲁棒视听语音识别的模式感知多视图自我监督表示
链接:https://arxiv.org/abs/2606.05763
作者:Fei Su, Cancan Li, Juan Liu, Ming Li
备注:submitted to IEEE Transactions on Audio, Speech, and Language Processing


【7】Enhancing Audio Captioning with Auxiliary AudioSet Semantics

标题:使用辅助AudioSet语义增强音频字幕
链接:https://arxiv.org/abs/2606.05717
作者:Shubham Gupta, Adarsh Arigala, Sri Rama Murty Kodukula


【8】Age-Aware Adapter Tuning for Children's Speech Recognition

标题:儿童语音识别的感知适配器调整
链接:https://arxiv.org/abs/2606.05440
作者:Jialu Li
备注:Our code is available at this https URL


【9】F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

标题:F3-Tokenizer:驯服音频自动编码器的理解和生成潜力
链接:https://arxiv.org/abs/2606.06357
作者:Dinghao Zhou, Xingchen Song, Di Wu, Pengyu Cheng, Shengfan Shen, Sixiang Lv
备注:Technical report; early work; 9 pages, 2 figures, 5 tables


【10】FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition

标题:基于FiLM的语音说话人条件反射LLM用于病理性语音识别
链接:https://arxiv.org/abs/2606.06211
作者:Fernando López, Santosh Kesiraju, Jordi Luque
备注:Accepted in Odyssey 2026: The Speaker and Language Recognition Workshop


【11】Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition

标题:Zero-Shot跨语言语音情感识别的描述区分表示
链接:https://arxiv.org/abs/2606.06200
作者:Jinyi Mi, Ding Ma, Tomoki Toda
备注:Accepted to Interspeech 2026


【12】Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition

标题:多任务学习还不够:双输出第二语言语音识别中的代表性纠缠
链接:https://arxiv.org/abs/2606.06065
作者:Seung Hwan Cho, Young-Min Kim
备注:5 pages, 2 figures, Accepted to the 43rd International Conference on Machine Learning Workshop on Machine Learning for Audio


【13】SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

标题:SpeechJBB:探索代码交换语音下大型音频语言模型的安全一致和理解
链接:https://arxiv.org/abs/2606.06037
作者:Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani


【14】To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

标题:多模式还是非模式:通过主动模式检测的查询自适应视听人检索
链接:https://arxiv.org/abs/2606.05931
作者:Erfan Loweimi, Mengjie Qian, Kate Knill, Guanfeng Wu, Chi-Ho Chan, Abbas Haider, Muhammad Awan, Josef Kittler, Hui Wang, Mark Gales
备注:INTERSPEECH 2026


【15】DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement

标题:DBHN-Net:用于低复杂度单耳语音增强的双分支混合神经网络
链接:https://arxiv.org/abs/2606.05911
作者:Cunhang Fan, Enrui Liu, Jing Zhou, Jian Kang, Jie Li, Andong Li, Jian Zhou, Zhao Lv, Xuelong Li
备注:This article has been accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)


【16】Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

标题:超越WER:环境临床抄写员的配对声学压力测试
链接:https://arxiv.org/abs/2606.05909
作者:Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang, Yang Ai, Zhen-Hua Ling, Lei Jiang, Zhi-Yang He
备注:Accepted to INTERSPEECH 2026


【17】GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech

标题:GLASS:接受GRPO训练的LoRA,用于Zero-Shot文本到语音中的声学风格引导
链接:https://arxiv.org/abs/2606.05889
作者:Jaehoon Kang, Yejin Lee, Kyuhong Shim


【18】UniVoice: A Unified Model for Speech and Singing Voice Generation

标题:UniVoice:语音和歌声生成的统一模型
链接:https://arxiv.org/abs/2606.05852
作者:Junjie Zheng, Huixin Xue, Shihong Ren, Chaofan Ding, Hao Liu, Zihao Chen
备注:9 pages, 2 figures


【19】Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs

标题:迈向真正的多语言ASB:将代码转换ASB推广到看不见的语言对
链接:https://arxiv.org/abs/2606.05846
作者:Gio Paik, Hyunseo Shin, Soungmin Lee
备注:ICML 2026 Workshop on Machine Learning for Audio


【20】FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval

标题:FOTE:文本音频rEtrieval的follow引导的最佳细化
链接:https://arxiv.org/abs/2606.05812
作者:Arghya Pal, Sailaja Rajanala
备注:Under Review


【21】SagnacAssisted Enhanced OTDR for Distributed Acoustic Sensing: A Standardized Benchmark and Engineering Evaluation Framework

标题:用于分布式声学传感的Sagnac辅助增强型TLR:标准化基准和工程评估框架
链接:https://arxiv.org/abs/2606.05754
作者:Weiguang Wang, Fugen Wu, Hailing Wang, Xuechen Liang, Xiaobin Li, Ru Han, Tianchang Xie


【22】Do speech foundation models perceive speaker similarity as humans do?

标题:语音基础模型是否像人类一样感知说话者的相似性?
链接:https://arxiv.org/abs/2606.05739
作者:Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi, Yuki Saito
备注:Accepted by INTERSPEECH 2026


【23】Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

标题:超越生成解码:用于多模式情绪分析的本地全模式LLM的区分性隐藏状态读出
链接:https://arxiv.org/abs/2606.05713
作者:Bin Wen, Tien-Ping Tan
备注:18 pages, 4 figures, 6 tables


【24】SB-RF: Schrödinger Bridge Rectified Flow for One-Step Robust Speech Enhancement

标题:SB-RF:用于一步稳健语音增强的薛定汉桥纠正流程
链接:https://arxiv.org/abs/2606.05575
作者:Caixia Lu, Xueyang Lv, Penglong Hu, Jiaming Xu


【25】Sound Effects Dataset Unification With the Universal Category System

标题:音效数据集与通用类别系统的统一
链接:https://arxiv.org/abs/2606.05571
作者:Jun Woo Beck, Alexander Lerch
备注:DAFx 2026 camera-ready version


【26】Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs

标题:使用特定于语言的统计图的领域感知发音错误检测和诊断
链接:https://arxiv.org/abs/2606.05569
作者:Huu Tuong Tu, Hanh Nguyen, Thien Van Luong, Nguyen Tien Cuong, Vu Huan, Nguyen Thi Thu Trang
备注:Accepted at Interspeech 2026


【27】Probing Spatial Structure in Pretrained Audio Representations

标题:探索预训练音频表示中的空间结构
链接:https://arxiv.org/abs/2606.05544
作者:Chuyang Chen, Sivan Ding, Adrian S. Roman, Juan Pablo Bello
备注:Accepted to Interspeech 2026


【28】Exploring LLMs for South Asian Music Understanding and Generation

标题:探索南亚音乐理解和生成的法学硕士
链接:https://arxiv.org/abs/2606.05522
作者:Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sajjad, Santu Karmaker
备注:19 pages, 7 figures


【29】nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies

标题:nnAudio 2:克服动态编译障碍并转变不确定性
链接:https://arxiv.org/abs/2606.05394
作者:Abhinaba Roy, Junyi Liang, Dorien Herremans


【30】Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech

标题:基于语音模型的文本到语音中情绪表达力控制的任务-载体算法
链接:https://arxiv.org/abs/2606.05367
作者:Daniel Oliveira de Brito, Arnaldo Candido Junior
备注:10 pages, 5 figures


【31】MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

标题:MCBench:Omni大型语言模型的多上下文安全评估基准
链接:https://arxiv.org/abs/2606.05177
作者:Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung


机器翻译由腾讯交互翻译提供,仅供参考