近日,EMNLP 2026正式公布录用结果,本期分享阿里 Token Foundry Qwen Audio 团队中稿的 3 篇论文,涵盖视频到音频生成、大语言模型推理增强、神经编解码语音合成三大前沿方向。 本次入选的 3 篇论文分别围绕跨模…
声浪
做过实时语音识别的人,大概率都见过这样一种场景: 你刚说完半句话,屏幕上的字幕已经出来了,但再多说几个字,前面的内容突然被改掉。字幕一会儿增加、一会儿回滚,甚至整句话重新刷新。如果只是看字幕,这可能只是“有点闪”。但当ASR的输出开始直接连…
近年来,大语言模型(LLM)与语音编码器结合形成的 Speech-LLM 在自动语音识别(ASR)领域取得了显著进展。然而,大规模 Speech-LLM 通常拥有数十亿参数,直接针对不同语言进行全参数微调,不仅训练成本高,而且难以扩展到大量…
为了推动语音对话与听觉领域的发展,加强委员之间的交流与合作,扩大语音对话与听觉专业委员会在国内外的影响力,中国计算机学会(CCF)语音对话与听觉专业委员会将于2026年11月5日至8日在珠海横琴召开专委会学术年会与年度工作会议,并进行委员纳…
近日,IIP-HCI实验室关于基于脑电的想象语音重建的最新研究成果被国际学术期刊 ACM TAAS 接收。期刊全称为 ACM Transactions on Autonomous and Adaptive Systems,由国际计算机学会(…
今日论文合集:CS.SD语音与音频 | 共 7 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别与关键词检测 1…
近日,清华大学电子工程系联合Google DeepMind、NVIDIA、剑桥大学等机构的研究人员,在期刊《自然·机器智能》(Nature Machine Intelligence)发表题为《迈向通用听觉智能:机器的聆听与表达》(Towar…
一边聊天,一边办事。 从办公协作,走进智能座舱。 在上一篇《qwen-audio-agent架构解析》中,我们主要围绕办公场景介绍了框架。这一次,我们把它带进智能汽车座舱。 我们做了一套可运行的智能座舱示例:接入车控、音乐、导航与天气,让用…
今日论文合集:CS.SD语音与音频 | 共 12 篇。 本文经arXiv每日学术速递授权转载,微信公众号:arXiv_Daily [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准 快速导航 1. 语音识别与关键词检测…
来源丨新智元 谷歌又杀回来了。 今夜,Google DeepMind 一口气放出两个模型——Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。 官方称它们是谷歌迄今最先进的实时对话模型。…
