声浪
清华吴志勇团队联合小米提出 TTS-PRISM:12 维精细化中文语音合成诊断框架
标题:《TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis》 链接:https://arxiv.org/pd…
16 0 0
小米MiMo-V2.5全量开源,再送 100 万亿 Token!
来源丨智东西 今天,小米正式开源 MiMo-V2.5 系列模型,采用MIT协议,允许商用推理部署与二次训练,无需额外授权。 ▲MiMo-V2.5-Pro在Hugging Face的开源页面截图 此前,该系列模型于4月23日开启公测,包括Mi…
29 0 0
2.1K Star!视频创作者的核弹级开源工具来了!一句话即输出成片。
FireRed-OpenStoryline将复杂的视频创作转化为自然直观的对话体验。兼顾易用性和企业级可靠性,让视频创作对初学者和创意爱好者都变得简单友好。 项目简介 FireRed-OpenStoryline是FireRedTeam团队开…
28 0 0
MAGIC-TTS:首个实现字级内容与停顿毫秒级控制的语音合成系统
在今天的语音合成系统里,听起来自然已经不再稀缺,但哪里该慢一点、哪个字该拉长、哪个位置该停顿、停多久,依然很难真正交给用户来控制。 但这恰恰是很多真实应用场景在意的问题。 比如导航播报里,“前方路口左转”中的“左转”往往需要更清楚、更突出;…
20 0 0
