开源语音数据库发布丨RealMAN
由于大规模实录多通道音频数据集的匮乏,基于深度学习的多通道语音增强和声源定位非常依赖于房间冲激响应以及多通道扩散噪声的仿真。然而,仿真数据与实录数据的声学特性差异会使得模型在泛化到真实场景中时增强与定位性能下降。为了降低仿真到真实泛化带来的…
68 0 0
由于大规模实录多通道音频数据集的匮乏,基于深度学习的多通道语音增强和声源定位非常依赖于房间冲激响应以及多通道扩散噪声的仿真。然而,仿真数据与实录数据的声学特性差异会使得模型在泛化到真实场景中时增强与定位性能下降。为了降低仿真到真实泛化带来的…
随着人工智能新一轮浪潮兴起,AI语音对话技术日趋成熟,带来越来越好的智能语音交互体验。但全球仍有大量语言障碍的人无法进行正常的沟通交流以及与智能语音产品交互。因此,为了加快技术迭代,快速推动相关项目的研发,希尔贝壳(AISHELL)开源了A…
评测数据开源: SPEECHIO_ASR_ZH000{08,09,10} 已开放下载。 场景分别为 [老罗语录],[播客:故事FM],[