微信公众号:arXiv_Daily
[机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准
快速导航
1. 语音识别与关键词检测 2 篇
2. 说话人识别、验证与分离 1 篇
3. 音频事件检测与场景理解 4 篇
4. 音乐信息检索与音乐生成 1 篇
5. 低资源、多语言与方言语音 1 篇
6. 数据集、基准与评测 3 篇
7. 安全、隐私与深度伪造音频 3 篇
8. 其他/综合语音音频 3 篇
1. 语音识别与关键词检测 | 2 篇
1. Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR
倾听、思考、转录:用于自动语音识别的连续潜在测试时间缩放
AI 总结:提出LatentASR方法,通过两个可训练模块在冻结的ASR主干上添加连续潜在测试时间缩放,在极小数据量下降低词错误率,动态停止可节省计算量,还能在多语言中泛化。
链接:https://arxiv.org/abs/2607.05051
2. Context-Aware ASR for Mandarin Technical Lectures
用于汉语技术讲座的上下文感知自动语音识别
AI 总结:研究汉语技术讲座中上下文对英文术语识别的作用,构建基准并定义以术语为中心的指标,提出两阶段无参考解码方法,提升术语召回率并降低字符错误率。
链接:https://arxiv.org/abs/2607.05058
2. 说话人识别、验证与分离 | 1 篇
3. Towards Robust Uncertainty-Aware Speaker Modeling
迈向稳健的不确定性感知说话人建模
AI 总结:研究针对说话人嵌入的不确定性估计及校准问题,提出稳健不确定性建模框架。核心方法是结合说话人间可分性与说话人内变异性的不确定性Softmax及不确定性校准域适应框架。贡献是提升不确定性可靠性与说话人识别稳健性。
链接:https://arxiv.org/abs/2607.04937
3. 音频事件检测与场景理解 | 4 篇
4. Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types
用于鸟类物种和叫声类型多任务生物声学分类的自适应损失平衡
AI 总结:研究被动声学监测中鸟类发声模型,扩展BirdCallNet用于长尾WiWa数据集的联合分类,评估四种鸟类领域编码器,比较不同损失平衡方法,发现最佳策略依主干、适应方式和目标任务而定。
链接:https://arxiv.org/abs/2607.03304
5. Trajectory Variance: AnUnsupervised Measure of Developmental Vocal Plasticity in Birdsong
轨迹方差:鸟类鸣叫发育中无监督的发声可塑性度量
AI 总结:研究鸟类鸣叫发育中发声变化,提出轨迹方差这一可塑性得分,用位移模型预测自动编码器潜在空间中年龄条件变化,其预测方差量化发声变化,能区分习得音节与先天鸣叫且与频谱平坦度相关。
链接:https://arxiv.org/abs/2607.03496
6. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding
Auto-AEG:用于开放词汇音频事件定位的可扩展数据构建
AI 总结:研究开放词汇音频事件定位任务,因数据稀缺受限。提出Auto-AEG可扩展管道,通过自动数据构建和模型微调构建监督,结合合成音频与伪标签训练,提升模型性能。
链接:https://arxiv.org/abs/2607.04383
7. Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection
用于首次异常声音检测的无训练模型选择和域感知分数校准
AI 总结:针对DCASE挑战任务2中首次异常声音检测问题,提出无训练事后层,通过每域分位数校准和无标签交叉验证域平衡标准解决相关问题,提升评估分数。
链接:https://arxiv.org/abs/2607.04526
4. 音乐信息检索与音乐生成 | 1 篇
8. Taste-aware music retrieval from audio embeddings
从音频嵌入中进行味觉感知音乐检索
AI 总结:将基于内容的音乐信息检索基准形式化,通过共享多任务回归头比较四个HEAR家族的十个音频编码器,采用门控后期融合,计算绝对误差和等级相关性以评估模型有效性,预测味觉空间效果优于基线。
链接:https://arxiv.org/abs/2607.03296
5. 低资源、多语言与方言语音 | 1 篇
9. TokAN: Accent Normalization Using Self-Supervised Speech Tokens
TokAN:使用自监督语音令牌进行口音归一化
AI 总结:研究提出TokAN框架,基于自监督离散语音令牌,用自回归编解码器转换口音,引入强化学习后训练,还用流匹配合成器和持续时间预测器,实验表明其在降低字错误率和提升可懂度上优于基线。
链接:https://arxiv.org/abs/2607.03928
6. 数据集、基准与评测 | 3 篇
10. Doppelganger: Sound Effects and Their Synthetic Twins
分身:音效及其合成孪生体
AI 总结:介绍Doppelganger基准,用于跨合成-真实边界匹配音效。通过配对真实与合成音频,测试不同训练方式对音频编码器跨边界匹配的影响,发现特定训练可提升匹配准确率,且该匹配具有生成器特异性。
链接:https://arxiv.org/abs/2607.04337
11. Sampling Bias Compensation for Robust Evaluation of Audio Classification Systems with Partially Labeled Evaluation Datasets
用于对具有部分标记评估数据集的音频分类系统进行稳健评估的采样偏差补偿
AI 总结:研究在严格标注预算约束下补偿评估标记子集偏差的方法,通过实现并比较三种密度比估计方法,利用主动学习技术生成标记子集进行实验,表明重要性加权能给出更现实准确度估计。
链接:https://arxiv.org/abs/2607.04463
12. Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification
用于生物声学事件分类的具有冗余控制的自适应多样性-不确定性主动学习
AI 总结:针对大规模生物声学监测中专家标注昂贵且数据分布不均问题,提出主动学习策略,联合建模预测不确定性、嵌入空间多样性和批内冗余,用自适应加权和贪心MMR程序提升标注效率。
链接:https://arxiv.org/abs/2607.04868
7. 安全、隐私与深度伪造音频 | 3 篇
13. DETECT-3B-Omni is Agnostic of Content and Demographics
DETECT-3B-Omni对内容和人口统计学特征不敏感
AI 总结:研究Resemble AI的DETECT-3B-Omni检测器语义独立性,用来自不同AI语音克隆系统的多样音频样本测试,通过等价测试表明其检测准确率不受语音内容、说话者性别、年龄和地区影响。
链接:https://arxiv.org/abs/2607.03418
14. Information-Geometric Superposed Vowel Evaluation: Part 1. Moraic Syllabary (Japanese)
信息几何叠加元音评估:第1部分。音节文字(日语)
AI 总结:以日语为例,通过分析语音频谱分布,利用瓦瑟斯坦度量评估频谱距离,结合持久同调进行拓扑映射,来区分生成式人工智能合成的虚假人类语音和自然语音。
链接:https://arxiv.org/abs/2607.04154
15. SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation
SynSFX:用于深度伪造检测和评估的多模型音效合成数据集
AI 总结:研究音频深度伪造检测中合成音效泛化问题,通过创建涵盖7种文本到音频模型的SynSFX数据集支持该研究方向。
链接:https://arxiv.org/abs/2607.04848
8. 其他/综合语音音频 | 3 篇
16. Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving
节拍器:限制缓存,为实时交互模型服务保持节奏
AI 总结:研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。
链接:https://arxiv.org/abs/2607.02640
17. EEG-Based Imagined Speech Decoding Using a Hybrid CNN-SNN Architecture
基于脑电图的想象语音解码:使用混合卷积神经网络-脉冲神经网络架构
AI 总结:研究针对脑电图信号想象语音解码难题,提出用卷积神经网络提取时间表征,再经脉冲神经网络进行生物启发式时间分类的混合解码方法,在基准测试中取得高准确率,证明该方法有效性。
链接:https://arxiv.org/abs/2607.03844
18. CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning
CARD:用于无编码器音频字幕的跨组件音频表示蒸馏
AI 总结:研究提出无编码器音频字幕模型CARD,去除推理时的编码器,用含合并LoRA适配器的投影仪给冻结的语言模型供能。通过跨组件蒸馏预训练音频教师模型,提升了CIDEr-D指标。
链接:https://arxiv.org/abs/2607.04619
