通义开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!
只需3秒录音,就能让你的声音无缝切换语种、方言与情绪——中、粤、日、英、开心、愤怒......9 种通用语言、18种方言,通通搞定! 一段嘈杂环境下的会议录音,AI 也能毫秒级输出文字,绕口令、RAP、背景音乐干扰,照样精准识别! 通义百聆…
26 0 0
只需3秒录音,就能让你的声音无缝切换语种、方言与情绪——中、粤、日、英、开心、愤怒......9 种通用语言、18种方言,通通搞定! 一段嘈杂环境下的会议录音,AI 也能毫秒级输出文字,绕口令、RAP、背景音乐干扰,照样精准识别! 通义百聆…
跨语言情感语音合成(Cross-lingual Emotional Speech Synthesis)旨在在不改变语音语言内容信息的前提下,将源语言语音中的情感特征自然迁移到目标语言的合成语音中。这一技术在电影配音、多语言虚拟人等场景中有着…
来源丨PaperWeekly 180 万小时、44k 高保真、支持全量微调——刚刚开源的 VoxCPM 1.5,技术细节全解密。 最近,面壁技术团队发布了 VoxCPM 1.5 版本,在持续优化开发者开发体验的同时,也带来了多项核心能力升级…
近日智谱正式发布工业级语音合成系统 GLM-TTS,并在 Hugging Face 和 ModelScope 上开放模型权重。 基于在数据筛选、基础模型结构、精品音色监督微调(SFT)范式和强化学习(RL)范式等多方面创新,GLM-TTS…
标题:《RRPO: Robust Reward Policy Optimization for LLM-Based Emotional TTS》 链接:https://arxiv.org/pdf/2512.04552 作者单位:阿里通义实验…
最近 TTS 领域是真的越来越卷了,国内外各个互联网大厂轮番上阵。 阿里通义(Qwen)团队最近在开源界简直是“劳模”级别的存在,这边又悄悄上新了全新的Qwen3-TTS。 而且一出手就明显是冲着「自然度 + 多音色 + 多语言」这一代标准…