微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
快速导航
1. 语音识别与关键词检测 2 篇
2. 语音合成与声音生成 8 篇
3. 说话人识别、验证与分离 3 篇
4. 语音增强、降噪与音频修复 2 篇
5. 音频事件检测与场景理解 3 篇
6. 音乐信息检索与音乐生成 3 篇
7. 低资源、多语言与方言语音 1 篇
8. 数据集、基准与评测 4 篇
9. 安全、隐私与深度伪造音频 6 篇
10. 其他/综合语音音频 7 篇
1. 语音识别与关键词检测 | 2 篇
1. Online Predictive Coding for Dual-Mode Self-Supervised Speech Model
在线预测编码用于双模式自监督语音模型
AI 总结:提出在线预测编码(OPC)和双模式层归一化,通过多步未来预测正则化寄存器,缩小流式与非流式语音识别的性能差距。
链接:https://arxiv.org/abs/2606.21268
2. From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection
从文本度量到模型内部:Whisper ASR幻觉检测研究
AI 总结:研究Whisper大模型在真实语音数据上的幻觉检测,通过文本、LLM和内部解码器状态三种方法,发现无参考文本时探测解码器表示性能最强,融合文本与内部状态的元分类器效果最佳。
链接:https://arxiv.org/abs/2606.23060
2. 语音合成与声音生成 | 8 篇
3. Imitation Learning for Elder-Facing Speech Synthesis
面向老年人的模仿学习语音合成
AI 总结:提出模仿学习框架,结合两阶段在线策略奖励学习改进GRPO,从专家演示中学习TTS模型,以解决老年人偏好数据获取困难的问题,在客观和主观指标上优于基线。
链接:https://arxiv.org/abs/2606.21053
4. SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion
SDP-Codec:一种带有音高注入的说话人解耦语音编解码器,用于低比特率编码和零样本语音转换
AI 总结:提出SDP-Codec,通过单阶段优化从预训练自监督编码器中提取局部令牌并注入归一化F0,实现说话人解耦,在低比特率下达到竞争性重构和强零样本语音转换,且说话人泄露最少。
链接:https://arxiv.org/abs/2606.21157
5. DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation
DisSpeech: 面向ASR增强的低资源可控普通话口吃语音合成
AI 总结:提出基于离散语音令牌的框架DisSpeech,通过显式口吃事件标签控制不同不流畅模式,结合非自回归掩码生成Transformer和韵律感知声学重建,在少于50小时数据下实现高质量可控口吃语音合成,有效提升ASR性能。
链接:https://arxiv.org/abs/2606.21457
6. Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead
基于有限前瞻的流式T5文本到语音合成
AI 总结:提出S5-TTS,一种基于T5的流式变体,通过编码器-解码器语言模型和单调对齐学习实现逐词增量语音合成,并引入前瞻因果掩码和交错多源蒸馏以在低延迟下保持质量。
链接:https://arxiv.org/abs/2606.21882
7. AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation
AugCodec:通过数据增强的低比特率解耦神经语音编解码器
AI 总结:提出AugCodec,利用数据增强将语音分解为语义、说话人和韵律三种令牌,在12.5Hz低比特率下实现优于现有方法的重建质量和解耦性能。
链接:https://arxiv.org/abs/2606.21893
8. ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech
ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理
AI 总结:针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。
链接:https://arxiv.org/abs/2606.21933
9. Physics-Informed Neural Operator for Speech Production Analysis
物理信息神经算子用于语音产生分析
AI 总结:提出首个基于物理信息神经算子的语音产生分析方法,直接学习一维波动方程,无需预计算监督数据,实现高效GPU并行模拟。
链接:https://arxiv.org/abs/2606.22364
10. Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS
合成Lombard效应:TTS中语音清晰度和发声努力的多级控制
AI 总结:提出基于流匹配的TTS模型,利用发声努力和发音伪标签实现连续解耦控制及词级强调,模拟Lombard效应,提升嘈杂环境下的语音清晰度。
链接:https://arxiv.org/abs/2606.23176
3. 说话人识别、验证与分离 | 3 篇
11. LISE : Listenable Interpretable Speaker Embeddings
LISE: 可听可解释的说话人嵌入
AI 总结:提出LISE框架,将预训练说话人嵌入分解为少量可解释分量,在保持说话人验证性能的同时,通过听辨实验证明其可解释性。
链接:https://arxiv.org/abs/2606.21305
12. Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings
面向开放集说话人属性预测的关键词附加大语言模型嵌入
AI 总结:提出利用大语言模型嵌入进行开放集说话人属性预测,通过关键词附加策略和top-k负损失,在LibriTTS-P上超越闭集基准并泛化到未见同义词。
链接:https://arxiv.org/abs/2606.21979
13. Kiwano: A Cutting-Edge Open-Source Toolkit for Speaker Verification
Kiwano:一个尖端的开源说话人验证工具包
AI 总结:本文介绍Kiwano,一个基于PyTorch的轻量级可扩展开源工具包,提供标准化流程、预训练模型和多种架构集成,旨在降低门槛并标准化评估,推动说话人验证研究与开发。
链接:https://arxiv.org/abs/2606.22369
4. 语音增强、降噪与音频修复 | 2 篇
14. Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement
基于DNN的语音增强中用于音素重建的时频加权损失
AI 总结:提出一种时频加权框架,通过调制SDR目标以强调高语音-噪声竞争和瞬态线索,改善音素重建,尤其提高辅音识别准确率。
链接:https://arxiv.org/abs/2606.21635
15. Improving Engine Sound Analysis in Hot-Test Environments via a RAB-U-Net (Residual Attention Block U-Net) Noise Removal Method
通过RAB-U-Net(残差注意力块U-Net)降噪方法改进热试环境中的发动机声音分析
AI 总结:提出一种基于残差注意力块增强U-Net的深度学习降噪方法,用于生产线上发动机热试时的背景噪声去除,显著提升发动机声音分析准确度。
链接:https://arxiv.org/abs/2606.21887
5. 音频事件检测与场景理解 | 3 篇
16. CoughPhase-CLR: Designing an acoustics-informed foundation model for coughing sound classification
CoughPhase-CLR:面向咳嗽声音分类的声学信息基础模型设计
AI 总结:提出自监督学习框架CoughPhase-CLR,利用咳嗽的生理相位构建正样本对进行表征学习,在COVID-19检测、COPD状态分类等下游任务中优于标准随机裁剪方法。
链接:https://arxiv.org/abs/2606.21411
17. InstructFX2FX: A Multi-turn Text-to-Preset Demo for Iterative Audio Effect Refinement
InstructFX2FX: 用于迭代音频效果优化的多轮文本到预设演示
AI 总结:提出InstructFX2FX,一种多轮文本引导的音频效果优化演示,结合语言模型和CLAP引导优化,实现迭代效果调整,相比纯LLM重提示基线将平均MMD降低约24%。
链接:https://arxiv.org/abs/2606.22005
18. An Analysis of Untrained Deep Reservoir Networks for Audio Surveillance
面向音频监控的未训练深度储备池网络分析
AI 总结:本文研究基于储备池计算的未训练循环模型,通过不同深度的双向回声状态网络进行紧急声音事件检测,在MIVIA数据集上评估深度、识别性能和计算效率的权衡,表明深度变体在噪声下更鲁棒,浅层变体在边缘设备上效率更优。
链接:https://arxiv.org/abs/2606.22218
6. 音乐信息检索与音乐生成 | 3 篇
19. LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU
LK Jam:使用角色感知GRU的实时人机交互音乐生成系统的系统架构与实现
AI 总结:提出LK_Jam系统,基于轻量级GRU和高性能音频主机架构,通过多维稀疏事件流和角色感知编码实现低延迟双向人机交互音乐生成,采用三阶段渐进训练策略提升交互质量。
链接:https://arxiv.org/abs/2606.21018
20. Improving Text-to-Music Generation with Human Preference Rewards
利用人类偏好奖励改进文本到音乐生成
AI 总结:提出结合人类偏好奖励(TuneJury)的文本到音乐生成方法,通过训练时奖励条件化、专家迭代、偏好微调等五项工程决策,在ATTM挑战中提升FAD-CLAP和CLAP分数。
链接:https://arxiv.org/abs/2606.21670
21. Libretto: Giving LLM Agents a Sense of Musical Structure
Libretto:赋予LLM智能体音乐结构感
AI 总结:提出Libretto框架,通过LLM原生语法(显式起始槽、声部、小节组织)和基于语料库的统计评估(节奏、和声、旋律等),实现符号音乐的生成、诊断与迭代自修正,将符号音乐转化为可测量、可编辑的对象。
链接:https://arxiv.org/abs/2606.22708
7. 低资源、多语言与方言语音 | 1 篇
22. Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment
跨语言检索增强分类用于构音障碍严重程度评估
AI 总结:提出跨语言检索增强分类(CRAC)方法,通过对齐-检索-融合流程利用另一种语言的语音数据,在说话人无关的三分类任务中,韩语和意大利语数据集上分别达到87.3%和86.7%的平衡准确率,比单语基线提升8.4和20.0个百分点。
链接:https://arxiv.org/abs/2606.22910
8. 数据集、基准与评测 | 4 篇
23. AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?
AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?
AI 总结:提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。
链接:https://arxiv.org/abs/2606.21147
24. ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition
ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集
AI 总结:本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。
链接:https://arxiv.org/abs/2606.22399
25. Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior
高效扩展音频模型:计算约束与优化行为的联合研究
AI 总结:针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。
链接:https://arxiv.org/abs/2606.22790
26. HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems
HALAS:现代ASR系统幻觉的人工标注数据集
AI 总结:提出HALAS,首个针对真实语音中ASR系统幻觉的人工标注数据集,揭示跨模型词汇重叠及低WER下的幻觉现象,并建立首个非人工基准。
链接:https://arxiv.org/abs/2606.23048
9. 安全、隐私与深度伪造音频 | 6 篇
27. Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks
利用神经音频编解码器潜变量进行对抗性音频攻击
AI 总结:提出在神经音频编解码器连续潜空间中生成对抗性扰动的方法,实现单次前向传播、低延迟(<7ms)的高成功率(99%)目标攻击。
链接:https://arxiv.org/abs/2606.20893
28. Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning
通过TTS生成投毒对语音情感识别的后门攻击
AI 总结:首次系统研究基于投毒的后门攻击对语音情感识别的影响,利用TTS生成音频嵌入隐蔽低能量声学触发器,实现高成功率攻击并揭示自监督表示的脆弱性。
链接:https://arxiv.org/abs/2606.21052
29. LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity
LambdaMark: 面向鲁棒性和放射性的语义音频水印
AI 总结:提出LambdaMark,首个通用放射性水印方案,通过将多比特水印嵌入语义音频潜在表示实现鲁棒性和放射性,实验证明在常见失真和去除攻击下表现优异。
链接:https://arxiv.org/abs/2606.21365
30. When EER Hides Deployment Failure: Auditing Threshold Transfer and Unlabeled Score Calibration for Speech Deepfake Detectors
当EER掩盖部署失败:语音深度伪造检测器的阈值迁移与无标签分数校准审计
AI 总结:本文审计了语音深度伪造检测器在部署时因阈值迁移导致的性能下降,发现等错误率(EER)无法反映实际错误,并证明常见无标签校准方法无法改善EER,建议同时报告迁移阈值下的半总错误率(HTER)。
链接:https://arxiv.org/abs/2606.21584
31. Learning to Evade: Adaptive Attacks on Audio Watermarking
学习规避:针对音频水印的自适应攻击
AI 总结:提出自适应音频水印攻击方法AWM,通过两阶段优化和分布参数估计,在保持高成功率的同时绕过检测器,检测率低于10%。
链接:https://arxiv.org/abs/2606.22310
32. The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection
水印捷径:来源标记如何破坏音频深度伪造检测
AI 总结:发现合成语音水印导致检测器依赖“水印=>伪造”捷径,引发泛化下降、去除水印逃逸和真实语音被误判为伪造三种故障,实验表明水印训练检测器错误率从16%升至75%,但双类水印重训练可消除捷径。
链接:https://arxiv.org/abs/2606.23335
10. 其他/综合语音音频 | 7 篇
33. A Generalized Formalism of Auto-Regressive Decoding for Speech Processing
语音处理中自回归解码的广义形式化描述
AI 总结:针对语音处理中自回归解码策略缺乏统一框架的问题,提出广义理论形式化,明确分类标准并简化基准设计,支持聚焦搜索策略的消融研究。
链接:https://arxiv.org/abs/2606.20714
34. An implicitization-based solution to the minimal 4s/6r ToA problem using Cayley--Menger determinants
基于Cayley-Menger行列式的极小4s/6r ToA问题的隐式化解法
AI 总结:提出一种利用Cayley-Menger行列式和隐式化技术的高效代数求解器,解决4发6收的到达时间自定位问题,数值精度比现有方法高约三个数量级,速度提升1.3倍。
链接:https://arxiv.org/abs/2606.20840
35. Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption
Bagpiper-Edit: 基于丰富描述的零样本开放式音频编辑
AI 总结:提出Bagpiper-Edit,通过将音频编辑转化为丰富描述重写任务,实现零样本、自由形式的开放式音频编辑,无需配对训练数据,在语音、音乐和声音上均表现良好。
链接:https://arxiv.org/abs/2606.21227
36. Sea-Scan: High-Accuracy, ML-based Dark Vessel Detection and Localisation via Weakly Supervised DAS Monitoring
Sea-Scan: 基于弱监督DAS监测的高精度ML黑暗船只检测与定位
AI 总结:提出一种基于弱监督学习的ML船只检测与定位系统,利用不完美AIS标签训练,在1.98%误触发率下达到97.8%检测率,成功识别未标记数据中的黑暗船只事件。
链接:https://arxiv.org/abs/2606.21326
37. Direct Raw Audio Signal Processing via Reservoir Computing: An Investigation into 'Feature-Free' Architectures
通过储层计算进行直接原始音频信号处理:对“无特征”架构的研究
AI 总结:本文评估储层计算作为音频处理的自主“无特征”框架,通过直接分类原始声学信号,消除手工特征提取,并比较浅层、序列和并行深度储层架构,发现并行方法在低复杂度下性能最优。
链接:https://arxiv.org/abs/2606.21335
38. Gradient-Based Learning of Parametric Engine Sound Representations for Real-Time Resynthesis and Tuning on Embedded Systems
基于梯度的参数化引擎声音表示学习用于嵌入式系统的实时重合成与调谐
AI 总结:提出一种基于神经网络和梯度优化的引擎声音建模方法,通过分析-合成学习紧凑参数表示,实现高保真重合成并兼容现有汽车音频框架,在嵌入式平台上验证可行性。
链接:https://arxiv.org/abs/2606.21521
39. What Do Neural Networks Learn for TDOA Estimation? A Cross-Architecture Probing Study
神经网络在TDOA估计中学到了什么?跨架构探针研究
AI 总结:通过探针分析三种神经网络架构,发现网络学习到跨功率计算和幅度感知频率加权,而非PHAT白化,且去除PHAT可提升加性噪声下的性能。
链接:https://arxiv.org/abs/2606.22020
