今日论文合集:cs.SD语音10篇,eess.AS音频处理5篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】Proceedings of The third international workshop on eXplainable AI for the Arts (XAIxArts)
标题:第三届eXplainable AI for the Arts(XAIxArts)国际研讨会会议录
链接:https://arxiv.org/abs/2511.10482

作者:Corey Ford, Elizabeth Wilson, Shuoyang Zheng, Gabriel Vigliensoni, Jeba Rezwana, Lanxi Xiao, Michael Clemens, Makayla Lewis, Drew Hemment, Alan Chamberlain, Helen Kennedy, Nick Bryan-Kinns
备注:Proceedings of The second international workshop on eXplainable AI for the Arts (XAIxArts)


【2】VocalNet-M2: Advancing Low-Latency Spoken Language Modeling via Integrated Multi-Codebook Tokenization and Multi-Token Prediction
标题:VocalNet-M2:通过集成的多码本令牌化和多令牌预测推进低延迟口语建模
链接:https://arxiv.org/abs/2511.10232

作者:Yuhao Wang, Ziyang Cheng, Heyang Liu, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang


【3】Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
标题:对多模式LLM的语音音频合成攻击及其使用SALMONN-Guard的缓解
链接:https://arxiv.org/abs/2511.10222

作者:Yudong Yang, Xuezhen Zhang, Zhifeng Han, Siyin Wang, Jimin Zhuang, Zengrui Jin, Jing Shao, Guangzhi Sun, Chao Zhang


【4】FabasedVC: Enhancing Voice Conversion with Text Modality Fusion and Phoneme-Level SSL Features
标题:FabasedVC:通过文本模式融合和音素级SSL功能增强语音转换
链接:https://arxiv.org/abs/2511.10112

作者:Wenyu Wang, Zhetao Hu, Yiquan Zhou, Jiacheng Xu, Zhiyu Wu, Chen Li, Shihao Li
备注:Accepted by ACMMM-Asia 2025


【5】Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation
标题:Audio-VLA:将接触式音频感知添加到机器人操纵的视觉-语言-动作模型中
链接:https://arxiv.org/abs/2511.09958

作者:Xiangyi Wei, Haotian Zhang, Xinyi Cao, Siyu Xie, Weifeng Ge, Yang Li, Changbo Wang


【6】HI-TransPA: Hearing Impairments Translation Personal Assistant
标题:HI-TransPA:听力障碍翻译私人助理
链接:https://arxiv.org/abs/2511.09915

作者:Zhiming Ma, Shiyu Gan, Junhao Zhao, Xianming Li, Qingyun Pan, Peidong Wang, Mingjun Pan, Yuhao Mo, Jiajie Cheng, Chengxin Chen, Zhonglun Cao, Chonghan Liu, Shi Cheng


【7】Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
标题:叛逆:音频推理模型的噪音稳健推理训练
链接:https://arxiv.org/abs/2511.09682

作者:Tiansheng Huang, Virat Shejwalkar, Oscar Chang, Milad Nasr, Ling Liu


【8】Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation
标题:音乐中的视频回响:视频到音乐生成的语义、时间和节奏对齐
链接:https://arxiv.org/abs/2511.09585

作者:Xinyi Tong, Yiran Zh, Jishang Chen, Chunru Zhan, Tianle Wang, Sirui Zhang, Nian Liu, Tiezheng Ge, Duo Xu, Xin Jin, Feng Yu, Song-Chun Zhu


【9】WaveRoll: JavaScript Library for Comparative MIDI Piano-Roll Visualization
标题:WaveRoll:用于比较铅笔钢琴滚动可视化的JavaScript库
链接:https://arxiv.org/abs/2511.09562

作者:Hannah Park, Dasaem Jeong
备注:Late-breaking/demo (LBD) at ISMIR 2025. this https URL


【10】Investigation of Feature Selection and Pooling Methods for Environmental Sound Classification
标题:环境声分类的特征选择和合并方法研究
链接:https://arxiv.org/abs/2511.09802

作者:Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar
备注:6 pages, 7 figures (including subfigures)


eess.AS音频处理


【1】Direction-of-Arrival and Noise Covariance Matrix joint estimation for beamforming
标题:到达方向和噪音协方差矩阵联合估计用于射束
链接:https://arxiv.org/abs/2511.10639

作者:Vitor Gelsleichter Probst Curtarelli


【2】Music Flamingo: Scaling Music Understanding in Audio Language Models
标题:音乐火烈鸟:在音频语言模型中扩展音乐理解
链接:https://arxiv.org/abs/2511.10289

作者:Sreyan Ghosh, Arushi Goel, Lasha Koroshinadze, Sang-gil Lee, Zhifeng Kong, Joao Felipe Santos, Ramani Duraiswami, Dinesh Manocha, Wei Ping, Mohammad Shoeybi, Bryan Catanzaro
备注:Project Page: this https URL


【3】A Study of Binaural Deep Beamforming With Interpretable Beampatterns Guided by Time-Varying RTF
标题:时变RTI引导的可解释束模式的双耳深射束形成研究
链接:https://arxiv.org/abs/2511.10168

作者:Ilai Zaidel, Sharon Gannot
备注:5 pages, 6 figures


【4】Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
标题:基于流匹配的Zero-ShotTTC中说话人相似性的时间层自适应对齐
链接:https://arxiv.org/abs/2511.09995

作者:Haoyu Li, Mingyang Han, Yu Xi, Dongxiao Wang, Hankun Wang, Haoxiang Shi, Boyu Li, Jun Song, Bo Zheng, Shuai Wang
备注:Submitted to ICASSP 2026


【5】MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
标题:MTR-DuplexBench:全面评估高保真语音语言模型的多轮对话
链接:https://arxiv.org/abs/2511.10262

作者:He Zhang, Wenqian Cui, Haoning Xu, Xiaohui Li, Lei Zhu, Shaohua Ma, Irwin King
备注:Work in progress


机器翻译由腾讯交互翻译提供,仅供参考