腾讯混元发布并开源统一语音基座模型 AuK :一个模型,把语音生成和编辑全包了
原创a month ago
腾讯混元发布并开源统一语音基座模型 AuK :一个模型,把语音生成和编辑全包了

语音克隆、指令驱动语音合成、语音编辑、语音增强、语音分离...如果你最近关注过语音模型,这些能力大概率分散在多个不同的模型里。 而腾讯混元最新开源的 AuK,把生成和编辑这一整条能力链,塞进了一个统一框架,并通过少步蒸馏得到了推理加速版本…

37 1 0
阿里最新开源丨语音分离、降噪、回声消除全覆盖:FLASepformer 与 JAEC 上线
转载a month ago
阿里最新开源丨语音分离、降噪、回声消除全覆盖:FLASepformer 与 JAEC 上线

语音交互和语音通信依赖清晰、可分辨的输入信号。真实环境中的风扇、道路、键盘等背景噪声会掩盖语音,扬声器回放进入麦克风会形成回声,多人同时讲话则会造成语音混叠。降噪、声学回声消除(AEC)和语音分离分别处理这三类问题,直接影响语音识别、唤醒与…

25 0 0
语音与音频学术速递[9.9]
原创a month ago
语音与音频学术速递[9.9]

今日论文合集:CS.SD语音与音频 | 共 21 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别与关键词检测…

14 0 0