华院计算 | 招聘语音合成工程师(上海)
华院由美国加州大学伯克利分校数学博士创立,成立于 2002 年,公司专注于数据智能研究。团队以基础算法研究和通用人工智能引擎开发为核心,从计算智能、感知智能,到认知智能,一直在人工智能算法研究领域处于行业前茅,产品与技术广泛应用于金融保险、…
20 0 0
华院由美国加州大学伯克利分校数学博士创立,成立于 2002 年,公司专注于数据智能研究。团队以基础算法研究和通用人工智能引擎开发为核心,从计算智能、感知智能,到认知智能,一直在人工智能算法研究领域处于行业前茅,产品与技术广泛应用于金融保险、…
论文标题:Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech 论文作者:刘瑞,何树伟,胡一帆,李…
MMAudio 在给定视频和/或文本输入的情况下生成同步音频。我们的关键创新是多模式联合训练,它允许对广泛的视听和音频文本数据集进行训练。此外,同步模块将生成的音频与视频帧对齐。 项目地址:https://hkchengrex.com/MM…
CosyVoice是阿里巴巴通义实验室语音团队于今年7月份开源的语音生成大模型,依托大模型技术,实现自然流畅的语音生成体验。与传统语音生成技术相比,CosyVoice具有韵律自然、音色逼真等特点。自开源以来,CosyVoice凭借高品质的多…
最近,西工大音频语音与语言处理研究组(ASLP@NPU)与微软、CUHK-Shenzhen提出首个说唱生成模型Freestyler,以歌词和伴奏输入,生成与伴奏风格节奏匹配的说唱;同时开源了首个说唱数据集RapBank。现对该论文进行简要的…