语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
语音与音频学术速递[7.31]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[7.31]

2026-07-31 | CS.SD语音与音频 | 共 9 篇 [机构]信息由AI分析生成,可能存在错误,仅供参考,以论文实际显示为准

语音合成语音识别
24 0 0
千问发布ASR模型  Qwen-Audio-3.0-ASR-Flash,长音频不丢词,行业词不用教
语音小管家语音小管家
转载2 months ago
千问发布ASR模型 Qwen-Audio-3.0-ASR-Flash,长音频不丢词,行业词不用教

今天,千问发布语音识别大模型Qwen-Audio-3.0-ASR-Flash。简单来说,就是让AI更好地听懂专业词汇。这次主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。…

语音识别
33 0 0
AmphionASR:“懂”场景支持大规模热词的个性化语音识别
语音小管家语音小管家
转载2 months ago
AmphionASR:“懂”场景支持大规模热词的个性化语音识别

本文来源:Amphion 如果把语音识别比作一场"听力考试",传统的ASR模型就像只准备了"标准普通话朗读"这一道题的考生。而现实中的语音场景远比“听写”复杂:会议室里多人同时发言、街头嘈杂环境中的通话、医生在病房里的低声交流、客服电话中的…

语音识别
31 0 0
万字长文详解全双工口语对话系统综述:架构层级、交互本体与决策状态机
语音小管家语音小管家
转载2 months ago
万字长文详解全双工口语对话系统综述:架构层级、交互本体与决策状态机

本文来源:乐百一家 论文题目:A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decis…

口语对话
52 0 0
语音与音频学术速递[7.30]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[7.30]

语音合成语音识别
18 0 0
开源项目|Agent Presence:开源实时语音框架 Qwen-Audio-Agent 来了
语音小管家语音小管家
转载2 months ago
开源项目|Agent Presence:开源实时语音框架 Qwen-Audio-Agent 来了

从《Her》里的温柔陪伴,到《普罗米修斯》里冷静执行任务的 David,再到《钢铁侠》里能理解上下文、调度系统、辅助决策的贾维斯,科幻作品一直在想象同一个问题: 真正自然的人机协作,应该是什么样子? 它不应该只是聊天框里的命令输入,也不应该…

实时语音
37 0 0
缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉
语音小管家语音小管家
转载2 months ago
缓解 TTS 的重复与漏读:用注意力引导消除语音合成中的稳定性幻觉

近年来,基于大语言模型的语音合成技术快速发展。在普通文本上,模型已经能够稳定生成自然度很高、音色也足够相似的语音。然而,一旦遇到复杂生僻词、排比句或连续重复结构,重复、漏读甚至无限循环等稳定性幻觉仍然可能出现。 这背后有一个基础问题: 语音…

语音合成
33 0 0
语音对话里的轮次判断:从级联到统一
语音小管家语音小管家
转载2 months ago
语音对话里的轮次判断:从级联到统一

本文来源:听见未来Tech 全双工(full-duplex)语音交互要求系统在用户说话的同时并行完成识别、理解与响应决策,其核心难点在于判断当前话轮是否结束——决定何时接话、何时继续等待。传统 VAD(Voice Activity Dete…

语音对话
45 0 0
语音与音频学术速递[7.29]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[7.29]

语音合成语音识别
19 0 0
当机器人开始全面认真倾听:音频具身智能综述来了
语音小管家语音小管家
转载2 months ago
当机器人开始全面认真倾听:音频具身智能综述来了

本文来源:SV4GoodAIlab 论文题目:Audio Embodied Intelligence: Auditory Perception, Reasoning, and Interaction for Multimodal Agent…

具身智能
47 1 0
‹1…89101112…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6TIOBE 场景测试:经济 金融 货币7TIOBE 场景测试:汽车之家 汽车评测8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9语音信号处理论文优选:Handling Background Noise in Neural Speech Generation10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号