微信公众号:arXiv_Daily
cs.SD语音
标题:F3-Tokenizer:驯服音频自动编码器的理解和生成潜力
链接:https://arxiv.org/abs/2606.06357
备注:Technical report; early work; 9 pages, 2 figures, 5 tables
【2】FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition
标题:基于FiLM的语音说话人条件反射LLM用于病理性语音识别链接:https://arxiv.org/abs/2606.06211
备注:Accepted in Odyssey 2026: The Speaker and Language Recognition Workshop
【3】Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition
标题:Zero-Shot跨语言语音情感识别的描述区分表示链接:https://arxiv.org/abs/2606.06200
备注:Accepted to Interspeech 2026
【4】Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition
标题:多任务学习还不够:双输出第二语言语音识别中的代表性纠缠链接:https://arxiv.org/abs/2606.06065
备注:5 pages, 2 figures, Accepted to the 43rd International Conference on Machine Learning Workshop on Machine Learning for Audio
【5】SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech
标题:SpeechJBB:探索代码交换语音下大型音频语言模型的安全一致和理解链接:https://arxiv.org/abs/2606.06037
【6】DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement
标题:DBHN-Net:用于低复杂度单耳语音增强的双分支混合神经网络链接:https://arxiv.org/abs/2606.05911
备注:This article has been accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)
【7】Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes
标题:超越WER:环境临床抄写员的配对声学压力测试链接:https://arxiv.org/abs/2606.05909
备注:Accepted to INTERSPEECH 2026
【8】GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech
标题:GLASS:接受GRPO训练的LoRA,用于Zero-Shot文本到语音中的声学风格引导链接:https://arxiv.org/abs/2606.05889
【9】UniVoice: A Unified Model for Speech and Singing Voice Generation
标题:UniVoice:语音和歌声生成的统一模型链接:https://arxiv.org/abs/2606.05852
备注:9 pages, 2 figures
【10】SagnacAssisted Enhanced OTDR for Distributed Acoustic Sensing: A Standardized Benchmark and Engineering Evaluation Framework
标题:用于分布式声学传感的Sagnac辅助增强型TLR:标准化基准和工程评估框架链接:https://arxiv.org/abs/2606.05754
【11】Do speech foundation models perceive speaker similarity as humans do?
标题:语音基础模型是否像人类一样感知说话者的相似性?链接:https://arxiv.org/abs/2606.05739
备注:Accepted by INTERSPEECH 2026
【12】Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis
标题:超越生成解码:用于多模式情绪分析的本地全模式LLM的区分性隐藏状态读出链接:https://arxiv.org/abs/2606.05713
备注:18 pages, 4 figures, 6 tables
【13】Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition
标题:超越波形鲁棒性:对自动语音识别的鲁棒性干扰声码器对抗攻击链接:https://arxiv.org/abs/2606.05678
备注:11 pages
【14】SB-RF: Schrödinger Bridge Rectified Flow for One-Step Robust Speech Enhancement
标题:SB-RF:用于一步稳健语音增强的薛定汉桥纠正流程链接:https://arxiv.org/abs/2606.05575
【15】Sound Effects Dataset Unification With the Universal Category System
标题:音效数据集与通用类别系统的统一链接:https://arxiv.org/abs/2606.05571
备注:DAFx 2026 camera-ready version
【16】Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs
标题:使用特定于语言的统计图的领域感知发音错误检测和诊断链接:https://arxiv.org/abs/2606.05569
备注:Accepted at Interspeech 2026
【17】Probing Spatial Structure in Pretrained Audio Representations
标题:探索预训练音频表示中的空间结构链接:https://arxiv.org/abs/2606.05544
备注:Accepted to Interspeech 2026
【18】Exploring LLMs for South Asian Music Understanding and Generation
标题:探索南亚音乐理解和生成的法学硕士链接:https://arxiv.org/abs/2606.05522
备注:19 pages, 7 figures
【19】nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies
标题:nnAudio 2:克服动态编译障碍并转变不确定性链接:https://arxiv.org/abs/2606.05394
【20】Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
标题:基于语音模型的文本到语音中情绪表达力控制的任务-载体算法链接:https://arxiv.org/abs/2606.05367
备注:10 pages, 5 figures
【21】USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding
标题:USAD 2.0:通用音频理解的缩放表示蒸馏链接:https://arxiv.org/abs/2606.06444
备注:Accepted to Interspeech 2026
【22】M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition
标题:M2 S-AVSR:用于鲁棒视听语音识别的模式感知多视图自我监督表示链接:https://arxiv.org/abs/2606.05763
备注:submitted to IEEE Transactions on Audio, Speech, and Language Processing
标题:USAD 2.0:通用音频理解的缩放表示蒸馏
链接:https://arxiv.org/abs/2606.06444
备注:Accepted to Interspeech 2026
【2】Revisiting Lexicon Evaluation in Unsupervised Word Discovery
标题:重新审视无监督单词发现中的词典评估链接:https://arxiv.org/abs/2606.06183
备注:6 figures
【3】CoSTA: Cognitive-State-Conditioned TTS Data Augmentation Using ASR Transcripts for Alzheimer's Disease Detection
标题:CoSTA:使用SVR转录物增强认知状态条件下的TTC数据以检测阿尔茨海默病链接:https://arxiv.org/abs/2606.06170
备注:Accepted by Interspeech 2026
【4】VoCodec: A Low-bitrate Streamable Neural Speech Codec with Voicing-driven Quantization
标题:VoCodec:具有语音驱动量化的低比特率可流传输神经语音编解码器链接:https://arxiv.org/abs/2606.05892
备注:Accepted to INTERSPEECH 2026
【5】An Ultra-Low-Bitrate Neural Speech Codec with Plain-to-Pseudo Synergistic Vector Quantization
标题:具有纯伪协同量化的超低比特率神经语音编解码器链接:https://arxiv.org/abs/2606.05876
备注:Accepted to INTERSPEECH 2026
【6】M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition
标题:M2 S-AVSR:用于鲁棒视听语音识别的模式感知多视图自我监督表示链接:https://arxiv.org/abs/2606.05763
备注:submitted to IEEE Transactions on Audio, Speech, and Language Processing
【7】Enhancing Audio Captioning with Auxiliary AudioSet Semantics
标题:使用辅助AudioSet语义增强音频字幕链接:https://arxiv.org/abs/2606.05717
【8】Age-Aware Adapter Tuning for Children's Speech Recognition
标题:儿童语音识别的感知适配器调整链接:https://arxiv.org/abs/2606.05440
备注:Our code is available at this https URL
【9】F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation
标题:F3-Tokenizer:驯服音频自动编码器的理解和生成潜力链接:https://arxiv.org/abs/2606.06357
备注:Technical report; early work; 9 pages, 2 figures, 5 tables
【10】FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition
标题:基于FiLM的语音说话人条件反射LLM用于病理性语音识别链接:https://arxiv.org/abs/2606.06211
备注:Accepted in Odyssey 2026: The Speaker and Language Recognition Workshop
【11】Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition
标题:Zero-Shot跨语言语音情感识别的描述区分表示链接:https://arxiv.org/abs/2606.06200
备注:Accepted to Interspeech 2026
【12】Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition
标题:多任务学习还不够:双输出第二语言语音识别中的代表性纠缠链接:https://arxiv.org/abs/2606.06065
备注:5 pages, 2 figures, Accepted to the 43rd International Conference on Machine Learning Workshop on Machine Learning for Audio
【13】SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech
标题:SpeechJBB:探索代码交换语音下大型音频语言模型的安全一致和理解链接:https://arxiv.org/abs/2606.06037
【14】To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection
标题:多模式还是非模式:通过主动模式检测的查询自适应视听人检索链接:https://arxiv.org/abs/2606.05931
备注:INTERSPEECH 2026
【15】DBHN-Net: Dual-Branch Hybrid Neural Network For Low-Complexity Monaural Speech Enhancement
标题:DBHN-Net:用于低复杂度单耳语音增强的双分支混合神经网络链接:https://arxiv.org/abs/2606.05911
备注:This article has been accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence(TPAMI)
【16】Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes
标题:超越WER:环境临床抄写员的配对声学压力测试链接:https://arxiv.org/abs/2606.05909
备注:Accepted to INTERSPEECH 2026
【17】GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech
标题:GLASS:接受GRPO训练的LoRA,用于Zero-Shot文本到语音中的声学风格引导链接:https://arxiv.org/abs/2606.05889
【18】UniVoice: A Unified Model for Speech and Singing Voice Generation
标题:UniVoice:语音和歌声生成的统一模型链接:https://arxiv.org/abs/2606.05852
备注:9 pages, 2 figures
【19】Towards Truly Multilingual ASR: Generalizing Code-Switching ASR to Unseen Language Pairs
标题:迈向真正的多语言ASB:将代码转换ASB推广到看不见的语言对链接:https://arxiv.org/abs/2606.05846
备注:ICML 2026 Workshop on Machine Learning for Audio
【20】FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval
标题:FOTE:文本音频rEtrieval的follow引导的最佳细化链接:https://arxiv.org/abs/2606.05812
备注:Under Review
【21】SagnacAssisted Enhanced OTDR for Distributed Acoustic Sensing: A Standardized Benchmark and Engineering Evaluation Framework
标题:用于分布式声学传感的Sagnac辅助增强型TLR:标准化基准和工程评估框架链接:https://arxiv.org/abs/2606.05754
【22】Do speech foundation models perceive speaker similarity as humans do?
标题:语音基础模型是否像人类一样感知说话者的相似性?链接:https://arxiv.org/abs/2606.05739
备注:Accepted by INTERSPEECH 2026
【23】Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis
标题:超越生成解码:用于多模式情绪分析的本地全模式LLM的区分性隐藏状态读出链接:https://arxiv.org/abs/2606.05713
备注:18 pages, 4 figures, 6 tables
【24】SB-RF: Schrödinger Bridge Rectified Flow for One-Step Robust Speech Enhancement
标题:SB-RF:用于一步稳健语音增强的薛定汉桥纠正流程链接:https://arxiv.org/abs/2606.05575
【25】Sound Effects Dataset Unification With the Universal Category System
标题:音效数据集与通用类别系统的统一链接:https://arxiv.org/abs/2606.05571
备注:DAFx 2026 camera-ready version
【26】Domain-Aware Mispronunciation Detection and Diagnosis Using Language-Specific Statistical Graphs
标题:使用特定于语言的统计图的领域感知发音错误检测和诊断链接:https://arxiv.org/abs/2606.05569
备注:Accepted at Interspeech 2026
【27】Probing Spatial Structure in Pretrained Audio Representations
标题:探索预训练音频表示中的空间结构链接:https://arxiv.org/abs/2606.05544
备注:Accepted to Interspeech 2026
【28】Exploring LLMs for South Asian Music Understanding and Generation
标题:探索南亚音乐理解和生成的法学硕士链接:https://arxiv.org/abs/2606.05522
备注:19 pages, 7 figures
【29】nnAudio 2: Overcoming Dynamic Compilation Barriers and Transform Inconsistencies
标题:nnAudio 2:克服动态编译障碍并转变不确定性链接:https://arxiv.org/abs/2606.05394
【30】Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
标题:基于语音模型的文本到语音中情绪表达力控制的任务-载体算法链接:https://arxiv.org/abs/2606.05367
备注:10 pages, 5 figures
【31】MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models
标题:MCBench:Omni大型语言模型的多上下文安全评估基准链接:https://arxiv.org/abs/2606.05177
机器翻译由腾讯交互翻译提供,仅供参考
