NCMMSC 2026 | ChinaVoices Challenge 2026:数据、任务、基线与方法总结
转载18 days ago
NCMMSC 2026 | ChinaVoices Challenge 2026:数据、任务、基线与方法总结

中文语音交互不仅需要处理普通话,也需要面对丰富的地域方言。对于一段方言语音,系统既要判断“说的是哪种方言”,也要准确识别“说了什么”。然而,现有研究采用的方言类别、训练资源和测试集并不统一,系统性能难以直接比较。 近期,西工大音频语音与语言…

算法资讯
20 0 0
EMNLP 2026|Qwen Audio 团队入选论文分享
原创20 days ago
EMNLP 2026|Qwen Audio 团队入选论文分享

近日,EMNLP 2026正式公布录用结果,本期分享阿里 Token Foundry Qwen Audio 团队中稿的 3 篇论文,涵盖视频到音频生成、大语言模型推理增强、神经编解码语音合成三大前沿方向。 本次入选的 3 篇论文分别围绕跨模…

算法资讯
38 0 0
网易有道开源流式ASR模型 R2T2,要做语音Agent 的 infra
原创22 days ago
网易有道开源流式ASR模型 R2T2,要做语音Agent 的 infra

做过实时语音识别的人,大概率都见过这样一种场景: 你刚说完半句话,屏幕上的字幕已经出来了,但再多说几个字,前面的内容突然被改掉。字幕一会儿增加、一会儿回滚,甚至整句话重新刷新。如果只是看字幕,这可能只是“有点闪”。但当ASR的输出开始直接连…

算法资讯
45 0 0
技术解读|Qwen Audio Agent 系列:座舱语音助手新范式
转载23 days ago
技术解读|Qwen Audio Agent 系列:座舱语音助手新范式

一边聊天,一边办事。 从办公协作,走进智能座舱。 在上一篇《qwen-audio-agent架构解析》中,我们主要围绕办公场景介绍了框架。这一次,我们把它带进智能汽车座舱。 我们做了一套可运行的智能座舱示例:接入车控、音乐、导航与天气,让用…

资讯算法
33 0 0
语音与音频学术速递[9.14]
原创a month ago
语音与音频学术速递[9.14]

今日论文合集:CS.SD语音与音频 | 共 9 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音合成与声音生成 2…

20 0 0