今日论文合集:cs.SD语音7篇,eess.AS音频处理7篇。


本文经arXiv每日学术速递授权转载

微信公众号:arXiv_Daily


cs.SD语音


【1】Articulatory strategy as a source of variation in acoustic vowel dynamics
标题:作为声元音动态变化来源的发音策略
链接:https://arxiv.org/abs/2605.23416
作者:Patrycja Strycharczuk,Justin J. H. Lo,Sam Kirkham


【2】AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ

标题:AffectCodec:基于块对角残差FSQ的语音编码算法
链接:https://arxiv.org/abs/2605.23373
作者:Zhaoyang Meng,Zhengyao Ma,Kecan Mao,Yingming Gao,Ya Li


【3】MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio

标题:MixFake:在多样化的现实世界混合音频中进行基准测试和增强音频Deepfake检测
链接:https://arxiv.org/abs/2605.23201
作者:Qingcao Li, Yipeng Lin, Weichen Lian, Zhongjie Ba, Peng Cheng, Zhichao Lian
备注:Accepted by ICME2026


【4】Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech

标题:Canary和WavLM的帧对齐融合用于助听器处理语音的非侵入性可理解度预测
链接:https://arxiv.org/abs/2605.23619
作者:Kazushi Nakazawa
备注:7 pages, 2 figures


【5】Word-Level Modeling with Alignment-Aware Acoustic Fusion for Text-Assisted Intelligibility Prediction in Listeners with Hearing Loss

标题:具有对齐感知声学融合的词级建模用于听力损失听众的文本辅助可理解度预测
链接:https://arxiv.org/abs/2605.23604
作者:Kazushi Nakazawa
备注:7 pages, 2 figures


【6】Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier

标题:声音分类器综合特征的时间检测能力评估
链接:https://arxiv.org/abs/2605.23293
作者:Martynas Dumpis, Tuomas Virtanen
备注:5 pages, 3 figures


【7】UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

标题:UniSOM:一种用于基于推理的细粒度评估的统一语音奖励模型
链接:https://arxiv.org/abs/2605.23261
作者:Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Yiwen Guo, Helen Meng, Xixin Wu
备注:Accepted by ACL 2026(Main)


eess.AS音频处理


【1】Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
标题:自然但易于检测:通过EMA和双重评分提示选择的稳健野外TTC--提交WildSpoof 2026年TTC曲目
链接:https://arxiv.org/abs/2605.23859
作者:Renhe Sun, Jiayi Zhou, Haolin He, Yueying Feng, Jian Liu


【2】Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech

标题:Canary和WavLM的帧对齐融合用于助听器处理语音的非侵入性可理解度预测
链接:https://arxiv.org/abs/2605.23619
作者:Kazushi Nakazawa
备注:7 pages, 2 figures


【3】Word-Level Modeling with Alignment-Aware Acoustic Fusion for Text-Assisted Intelligibility Prediction in Listeners with Hearing Loss

标题:具有对齐感知声学融合的词级建模用于听力损失听众的文本辅助可理解度预测
链接:https://arxiv.org/abs/2605.23604
作者:Kazushi Nakazawa
备注:7 pages, 2 figures


【4】A study on weakly-supervised training approaches for phoneme-level pronunciation scoring

标题:音素级发音评分弱监督训练方法研究
链接:https://arxiv.org/abs/2605.23593
作者:Jazmín Vidal, Luciana Ferrer


【5】StepAudio 2.5 Technical Report

标题:StepAudio 2.5技术报告
链接:https://arxiv.org/abs/2605.23463
作者:Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao, Daijiao Liu, Fei Tian, Feng Tian, Haiyang Sun, Haoyang Zhang, Jiangjie Zhen, Jinglan Gong, Jun Chen, Li Xie, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Runze Li, Shenghua Hu, Siyi Zhou, Wenwen Qu, Xiangyu Li, Xiangyu Tony Zhang, Xuerui Yang, Yang Yang, Yechang Huang, Yu Fu, Yuchu Luo, Yuxin Li, Yuxin Zhang, Zhengyan Sheng, Brian Li, Chang Zeng, Changlin Zhang, Chen Geng, Chenghao Dong, Chengli Feng, Dan Zhou, Danni Wan, Di Chen, Die Zhang, Dongqing Pang, Guanglong Yang, Guoqiang Hu, Huangxi Zhu, Jianzheng Gao, Jinghua Liang, Jinmei Wan, Junjie Yuan, Kang An, Lei Lei, Limin Zhong, Lun Cai, Mengqiang Ren, Min Xu, Mingliang Li, Mingxiao Li, Na Wang, Qiang Tong, Qiaoling Huang, Qingfu Du, Rui Wang, Shengchen Zhou, Shi Qiu, Shihao Peng, Shiliang Yang, Siqi Tu, Tianjiao Deng, Ting Xu, Tong Wang, WeiMing Niu, Wuxun Xie, Xianwei Zhang, Xianyu Feng, Xiaojia Liu, Xing Chen, Xiongbin Wu, Yan Wu, Yang Li, Yi Liu, Yifan Zhang, Yile Liu, Yongshen Long, Yu Luo, Yuanhao Ding, Yuhao Wang, Yuhe Yin, Yunfang Xu, Yuxiang Yang, Zhiguo Huang, Zhiyue Wu, Zichao Li, Zichao Zhou, Daxin Jiang, Future Li, Gang Yu, Xiangyu Zhang, Yibo Zhu


【6】Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier

标题:声音分类器综合特征的时间检测能力评估
链接:https://arxiv.org/abs/2605.23293
作者:Martynas Dumpis, Tuomas Virtanen
备注:5 pages, 3 figures


【7】UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

标题:UniSOM:一种用于基于推理的细粒度评估的统一语音奖励模型
链接:https://arxiv.org/abs/2605.23261
作者:Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Yiwen Guo, Helen Meng, Xixin Wu
备注:Accepted by ACL 2026(Main)


机器翻译由腾讯交互翻译提供,仅供参考


图片
永久福利 直投简历
简历投递:join@speechhome.com
图片
扫码关注我们
助力AI语音开发者的社区
图片