🎯中文口语语言处理国际会议 International Symposium on Chinese Spoken Langauge Processing (ISCSLP) 会议时间:2026年11月14-17日 会议地点:马来西亚·槟城 往…
声浪
语音AI企业的绝佳曝光机会 | ISCSLP 2026 赞助商招募中!
20 0 0
ICME 2026|基于细粒度视听证据解耦的鲁棒多模态情感推理
多模态情感分析正经历从静态分类向生成式推理(Generative Reasoning)的深刻范式转变。为了理解复杂的社交互动,系统必须能够综合诸如面部微表情和语音韵律等细粒度信号,以解码潜在的因果逻辑。 近年来,虽然通用多模态大语言模型(如…
23 0 0
南京大学等联合发布开源语音大模型VITA-Qinyu,首发支持角色扮演+哼唱
来源丨paperWeekly 近日,南京大学与腾讯音乐发布开源语音大模型 VITA-Qinyu ,这是业内首款兼具自然对话、高表现力角色扮演与歌唱能力的 开源端到端语音语言模型 (SLM)。目前 VITA-QinYu 的训练代码与模型权重全…
29 0 0
AAAI 2026|多指标偏好对齐,让生成式降噪更好听
语音修复(Speech Restoration)要解决的事很朴素: 把一段“坏掉的语音”修回“听起来像正常录音”的样子。坏的方式很多,比如: 降噪:背景嘶嘶声、风噪、环境噪 去混响:房间回声太大 去削波/爆音(declipping):录音过…
30 0 0
告别 “聊不到一块去”!港中大提出TurnGuide:让全双工语音大模型兼具“极致拟人”与“满分语商”!
文章链接:https://arxiv.org/pdf/2508.07375 想象一下,当你和AI 语音助手聊天时,它可以像真人一样自然地倾听、适时地“嗯、啊”附和,甚至在你打断它时迅速反应。这就是全双工语音大模型(FD-SLMs)的魅力所在…
29 0 0
Voxtral TTS,仅4B参数SOTA性能,超低延迟9种语言语音生成转录和24kHz音频输出。
来源丨AIGC Studio Voxtral TTS是首个在多语言语音生成方面拥有顶尖性能的文本转语音模型。基于大型语音数据集进行训练,专为全球应用而构建。它支持 9 种语言,性能一流:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语…
21 0 0
RTE 开发者社区发布 RealNoise™ TTS:全球首个原生合成动态声场的语音大模型
来源丨RTE 开发者社区 🔊本文是RTE开发者社区于4月1日愚人节和 AI 一起凭空造了一个能「感知语境并动态合成环境噪声的 TTS 模型」,虽是愚人节彩蛋,但有一定的参考价值。🔊 近日, 由 RTE 开发者社区共创孵化的 Noice…
30 0 0
