npj Acoustics | 基于上下文嵌入的鸡尾酒会多说话人语音分离与识别
随着深度学习在语音处理领域的不断突破,多说话人语音分离与识别(Multi-talker Speech Separation & Recognition)已成为推动“鸡尾酒会问题”解决的研究热点。然而,现有方法尽管在性能上取得了一定进展,却仍…
20 0 0
随着深度学习在语音处理领域的不断突破,多说话人语音分离与识别(Multi-talker Speech Separation & Recognition)已成为推动“鸡尾酒会问题”解决的研究热点。然而,现有方法尽管在性能上取得了一定进展,却仍…
随着深度学习在过去十年间的蓬勃发展,自动语音识别(ASR)技术获得了广泛关注,促使大量公开可用的ASR系统应运而生,并正积极融入我们的日常生活。然而,由于各种细微差异的存在,对这些ASR系统进行公正且可复现的评估面临挑战。 本文介绍了Spe…
来源丨机器之心 近日,kimi 又发布了新的开源项目 —— 一个全新的通用音频基础模型 Kimi-Audio,支持语音识别、音频理解、音频转文本、语音对话等多种任务,在十多个音频基准测试中实现了最先进的 (SOTA) 性能。 结果显示,Ki…