今日论文合集:CS.SD语音与音频 | 共 20 篇。
本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
1. Parallel Time-Band Mixing with Learned Observation-Adding for Robust ASR Front-Ends
用于稳健ASR前端的带学习型观测添加的并行时间-频带混合
AI 总结:提出带学习型观测添加的并行时间-频带混合前端,用于稳健ASR,可降低词错误率且参数量与计算量小。
链接:https://arxiv.org/abs/2608.30326
机构:Concordia University(康考迪亚大学); McGill University(麦吉尔大学); Shenzhen University of Advanced Technology(深圳理工大学)
作者:Xingyu Shen, Runze Wang, Wei-Ping Zhu, Benoit Champagne
2. Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper
步长k子采样:无需训练的Whisper音频令牌缩减方法
AI 总结:该研究提出无需训练的步长k子采样方法,可减少Whisper音频令牌,降低计算量与延迟,在多数ASR基准上仅产生小的WER损失,适用于Whisper及基于其的语音语言模型。
链接:https://arxiv.org/abs/2608.30927
机构:Chung-Ang University(中央大学)
作者:Chanhee Cho, Junhyuk Choi, Bugeun Kim
3. Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction
诊断后优化:基于AudioLLM引导校正的闭环TTS系统
AI 总结:针对开环TTS易出现韵律缺陷且指标难检测的问题,提出含AudioLLM评判器与细粒度优化器的LoopTTS框架,构建4.2万示例数据集训练优化器,实验表明其修复质量与指令遵循能力更优。
链接:https://arxiv.org/abs/2608.28970
机构:National University of Singapore(新加坡国立大学); Tencent(腾讯); LIGHTSPEED(光速); Nanyang Technological University(南洋理工大学); The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)); Shenzhen Loop Area Institute(深圳河套学院)
作者:Zeyang Song, Tianchi Liu, Tianrui Wang, Chenglin Xu, Steven Y. Guo, Haizhou Li
4. PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation
PhysWave:用于可控空间音频生成的物理引导潜在扩散模型
AI 总结:PhysWave是一种物理引导潜在扩散模型,通过统一控制与加入声学先验,生成空间一致的文本到FOA音频,还构建了30万段FOA数据集,可用于推理时的空间优化。
链接:https://arxiv.org/abs/2608.29549
机构:University of Houston(休斯顿大学); Stevens Institute of Technology(史蒂文斯理工学院); Waseda University(早稻田大学)
作者:Lingfeng Yao, Chenpei Huang, Xingke Yang, Ziye Geng, Changqing Luo, Hao Wang, Jiang Liu, Miao Pan
5. Neural Multichannel Distant Speaker Diarization and Source Separation with Beta Speaker Activity Prior
基于Beta说话人活动先验的神经多通道远场说话人 diarization 与源分离
AI 总结:本文针对神经 FCASA 方法提出带 Beta 说话人活动先验的贝叶斯 diarization 模型,在 AMI 数据集上使 diarization 和 Jaccard 错误率显著降低,提升了远场说话人 diarization 的鲁棒性。
链接:https://arxiv.org/abs/2608.28661
机构:LTCI, Telecom Paris, Institut Polytechnique de Paris(LTCI、巴黎电信学院、巴黎综合理工学院); LIUM, Universite du Mans(LIUM、勒芒大学)
作者:Sicheng Mao, Mathieu Fontaine, Anthony Larcher, Roland Badeau
6. Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers
Ouroboros:通过干净音频触发器对语音增强实施自指涉后门攻击
AI总结:本文提出新型后门攻击框架Ouroboros,利用语音增强模型的理想干净输出作为自然触发器,实现无需外部注入的推理阶段后门激活,攻击成功率高且对常见防御有效。
链接:https://arxiv.org/abs/2608.30329
机构:Faculty of Electrical Engineering and Computer Science, Ningbo University(宁波大学电气工程与计算机科学学院); College of Artificial Intelligence, Ningbo University of Finance and Economics(宁波财经学院人工智能学院)
作者:Yunjie Zhou, Yuheng Huang, Diqun Yan
7. Perceptually Better, Semantically Worse: Measuring Speech Enhancement Impact on LLM-Based Voice Systems
感知上更优,语义上更差:衡量语音增强对基于大语言模型的语音系统的影响
AI 总结:该研究针对语音增强对LLM语音系统的影响问题,提出输出分歧率(ODR)指标,通过基准测试发现标准音频质量指标无法适配LLM流程质量评估,验证了SE引发的语义失真会传递至下游LLM任务。
链接:https://arxiv.org/abs/2608.30348
机构:GN Group(GN集团)
作者:Randy Frans Fela, Pejman Mowlaee
8. VIBE: Video Instruction-aligned Background music gEneration
VIBE:视频指令对齐背景音乐生成模型
AI 总结:VIBE是一种新型文本与视频生成音乐模型,通过深度跨层条件机制与五阶段奖励建模优化,提升了音乐生成的可控性与指令依从性,在生成保真度上与多数基准模型相当。
链接:https://arxiv.org/abs/2608.30125
机构:Dolby Laboratories(杜比实验室); University of Maryland, College Park(马里兰大学帕克分校)
作者:Aryan Vijay Bhosale, Vaibhavi Lokegaonkar, Vishnu Raj, Gouthaman KV, Sreyan Ghosh, Ramani Duraiswami, Lie Lu, Dinesh Manocha
9. CoJEPA: Combining Contrastive Learning and JEPA for Global-Local Music Representations
CoJEPA:结合对比学习与JEPA以获取全局-局部音乐表征
AI 总结:本研究提出CoJEPA,将对比学习与JEPA结合,在MIR任务上性能优于或匹配单独方法,无需额外参数或任务特定架构改动,鼓励关注智能训练目标而非增大模型规模。
链接:https://arxiv.org/abs/2608.30974
作者:Gabriel Meseguer-Brocal, Yuexuan Kong, Romain Hennequin
10. What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models
你在听什么?面向音频-文本大语言模型的时序音乐定位
AI 总结:本文提出时序音乐定位任务,构建基准集MusicGroundingBench评估音频-语言模型的该能力,发现当前模型完成该任务仍具挑战,任务特定训练可提升性能,该基准可用于评估模型回应是否基于音乐证据。
链接:https://arxiv.org/abs/2608.29480
机构:Schulich School of Music, McGill University(麦吉尔大学舒利希音乐学院); CIRMMT (Centre for Interdisciplinary Research in Music Media and Technology)(音乐媒体与技术跨学科研究中心(CIRMMT)); Courant Institute, New York University(纽约大学柯朗研究所); Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI))
作者:Kun Fang, Ziyu Wang, Ichiro Fujinaga
11. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models
TEMPO:面向大型音频-语言模型的时序锚定多任务后训练
AI 总结:TEMPO是首个处理音频、语音和音乐时间戳任务的统一模型,通过SFT结合GRPO方法,在10K样本评估基准上优于Audio Flamingo Next等最先进模型。
链接:https://arxiv.org/abs/2608.29999
机构:University of Maryland, College Park(马里兰大学帕克分校); CNH Industrial India(凯斯纽荷兰工业印度公司)
作者:Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh, Utathya Aich, Ramani Duraiswami, Dinesh Manocha
12. SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards
SPHERE:通过结合空间启发式奖励的音频语言模型后训练实现自动音乐上混
AI 总结:该研究提出基于音频语言模型后训练的自动音乐上混方法,设计含6个子奖励的Sphere奖励套件,证明领域知识可蒸馏入语言模型实现该任务。
链接:https://arxiv.org/abs/2608.30559
机构:Meta Reality Labs(元宇宙实验室); Queen Mary University of London(伦敦玛丽女王大学)
作者:Zixun Guo, Calvin Murdock, Sanjeel Parekh, W Owen Brimijoin, Simon Dixon, Joshua Reiss, Ishwarya Ananthabhotla
13. Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection
面向通用型大语言模型的深度伪造语音检测的文本声学接地
AI 总结:该研究针对深度伪造语音检测的域泛化问题,提出跨模态提示策略,将openSMILE提取的声学特征作为文本标记注入冻结Qwen LLM,在ITW、MLAAD基准上获16.2%宏观F1绝对提升,性能最优。
链接:https://arxiv.org/abs/2608.30622
机构:German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心); National Institute of Informatics(情报信息学研究所); Technical University of Berlin(柏林工业大学)
作者:Yassine El Kheir, Xin Wang, Wanqing Ge, Tim Polzehl, Sebastian Moeller, Junichi Yamagishi
14. How Well Do Generative Music Models Follow Emotion Conditioning?
生成式音乐模型在情绪条件跟随方面的表现如何?
AI 总结:本研究构建统一评估流程,以GTZAN数据集为基础,评估Stable Audio Open等三个生成式音乐模型的情绪跟随表现,发现文本条件生成更优,效价保留更可靠,强调直接评估情感可控性的重要性。
链接:https://arxiv.org/abs/2608.29987
作者:Morteza Heydari
15. Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning
闭合验证循环:用于长段落详细音频字幕的自检查字幕生成
AI总结:本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。
链接:https://arxiv.org/abs/2608.30713
机构:The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)); Kuaishou Technology(快手科技)
作者:Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu
16. Evoking Harmony via Convolution
通过卷积唤起和声
AI 总结:本研究提出 Csound 的 chord_convolver 方法,通过卷积从任意源声音唤起和弦音级内容,对比线性频梳滤波器等并在野外录音中实现音乐应用,最小化伪影。
链接:https://arxiv.org/abs/2608.28851
机构:Irreducible Productions(不可约制作公司)
作者:Michael Gogins
17. Vocal Music under Phoneme-Conditional Analysis
音素条件分析下的声乐
AI 总结:该研究提出音素条件分析方法,通过9种语言的数千首无伴奏歌曲实验,以85.5%的平衡准确率识别语言,发现音系结构在演唱中留下可测量痕迹。
链接:https://arxiv.org/abs/2608.30823
作者:Hayoon Kim, Kyogu Lee
18. Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models
基于扩散模型的可演奏性感知音频到吉他指板谱的转录
AI 总结:该研究针对吉他指板谱转录的可演奏性问题,提出扩散模型Noise2Fret,引入五种辅助损失优化训练目标,在GuitarSet和GOAT数据集上实现优于基线的性能与计算效率。
链接:https://arxiv.org/abs/2608.30854
机构:Univ. Bordeaux(波尔多大学); CNRS(法国国家科学研究中心); Bordeaux INP(波尔多国立综合理工学院); LaBRI(计算机科学、图像与智能研究所)
作者:Riccardo Simionato, Louis Bigo
19. Decoupled Latent Flow Matching for Few-Step Joint Vocal-Accompaniment Separation
用于少步联合人声-伴奏分离的解耦潜在流匹配
AI 总结:本文提出解耦潜在流匹配框架,通过VAE与Flow2GAN相关技术实现少步联合人声-伴奏分离,在减少采样预算时可提升分离性能与感知质量。
链接:https://arxiv.org/abs/2608.30913
机构:Hong Kong Polytechnic University(香港理工大学)
作者:Lishi Zuo, Youzhi Tu, Lu Yi, Zezhong Jin, Chongxin Gan, Man-Wai Mak, KongAik Lee
20. MusGU+: Toward a Musician-Centered Evaluation Framework and Discovery Tool for Generative Music AI
MusGU+:面向生成式音乐AI的以音乐家为中心的评估框架与发现工具
AI 总结:针对现有生成式音乐系统评估方法的局限,提出以音乐家为中心的MusGU+框架,评估10款系统并开发交互式筛选工具,助力音乐家理性选用生成式音乐AI。
链接:https://arxiv.org/abs/2608.30940
机构:Universitat Pompeu Fabra(庞培法布拉大学); Music Technology Group(音乐技术组)
作者:Laura Ibáñez-Martínez, Roser Batlle-Roca, Xavier Serra, Martín Rocamora
