多模态说话人开源项目3D-Speaker
转载3 years ago
多模态说话人开源项目3D-Speaker

3D-Speaker是通义实验室语音团队贡献的一个结合了声学、语义、视觉三维模态信息来解决说话人任务的开源项目。本项目涵盖说话人日志,说话人识别和语种识别任务,开源了多个任务的工业级模型,训练代码和推理代码。 本项目同时还开源了相应的研究数…

129 0 0
Meta新算法提高语音识别的清晰度和鲁棒性
转载3 years ago
Meta新算法提高语音识别的清晰度和鲁棒性

语音识别系统应该足够强大,能够适合所有人群——包括具有不同说话风格、口音和其他特征的人群。为了衡量自动语音识别(ASR)工具在不同人口群体中的表现,人工智能从业者需要多样化的语音数据。为了与开放科学方法保持一致,Meta发布了一个以公平为导…

56 0 0
ICASSP2024 | 面向多种阵列拓扑的多通道语音识别模型:自动通道选择和空间特征融合
ICASSP2024 | 面向多种阵列拓扑的多通道语音识别模型:自动通道选择和空间特征融合

多通道语音识别(Multi-channel ASR)的目标是识别由多个麦克风(如麦克风阵列)拾取的多通道音频,相较于标准的单通道语音识别,多通道语音识别通过有效利用多通道信号提供的空间信息,帮助提升语音识别的性能。在实际应用中,由于麦克风阵…

56 0 0