语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA
语音小管家语音小管家
转载3 months ago
STAR-VAE:让音频潜在空间「按信息重要性」排列,重建与生成双双达到 SOTA

来源丨阿里语音AI 阿里团队的最新研究STAR-VAE已被机器学习顶级会议ICML 2026接收。这项工作聚焦音频生成中一个长期被忽视、却决定效果上限的底层环节——音频 VAE(连续 tokenizer),并提出了一种通用且即插即用的正则化…

音频
33 0 0
ACL 2026 | SDiaReward:面向多轮口语对话的端到端奖励建模与评测基准
语音小管家语音小管家
原创3 months ago
ACL 2026 | SDiaReward:面向多轮口语对话的端到端奖励建模与评测基准

近日,浙江大学团队提出的论文SDiaReward: Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness被ACL 2026 Ma…

评测基准
18 0 0
千问发布 Qwen-Audio-3.0-Realtime,让语音交互“懂倾听,更聪明”
语音小管家语音小管家
转载3 months ago
千问发布 Qwen-Audio-3.0-Realtime,让语音交互“懂倾听,更聪明”

今天,和大家分享阿里语音交互模型 Fun-Realtime-AudioChat 的全面升级(现已更名为 Qwen-Audio-3.0-Realtime),为大家带来这套完备的实时语音交互对话方案。 亮点速看 1. 根据语境动态调整语气与情感…

语音交互
37 0 0
语音与音频学术速递[7.15]
每日语音速递每日语音速递
原创3 months ago
语音与音频学术速递[7.15]

语音合成语音识别
15 0 0
通义开源 Wan-Dancer,从音乐直接生成1分钟+高画质同步舞蹈视频
语音小管家语音小管家
转载3 months ago
通义开源 Wan-Dancer,从音乐直接生成1分钟+高画质同步舞蹈视频

来源丨魔搭社区 通义万相开源 Wan-Dancer,一款音乐驱动的人像舞蹈视频生成模型。输入一张人物照片和一段音乐,即可自动生成节奏精准、动作流畅、风格鲜明的高质量舞蹈视频。首次突破分钟级时序瓶颈,支持15秒到3分钟的超长连贯输出,覆盖中国…

开源模型
21 0 0
Interspeech2026 | MSU-Bench:多说话人对话理解评测基准
语音小管家语音小管家
转载3 months ago
Interspeech2026 | MSU-Bench:多说话人对话理解评测基准

近年来,音频语言模型(Audio Language Model, ALMs)推动语音理解从传统单任务系统走向统一的音频到文本生成范式。在这一框架下,说话人验证、语音识别、说话人识别与时间戳标注等任务都可以被重新组织为可交互、可解释的生成式任…

多说话人对话理解
19 0 0
语音与音频学术速递[7.14]
每日语音速递每日语音速递
原创3 months ago
语音与音频学术速递[7.14]

语音合成语音识别
14 0 0
【论文导读】CCF语音对话与听觉专委会论文导读(2026年第10期)
语音小管家语音小管家
转载3 months ago
【论文导读】CCF语音对话与听觉专委会论文导读(2026年第10期)

本期分享国防科技大学与湖南师范大学近期发表在IEEE Transactions on Neural Networks and Learning Systems的一篇语音人脸多模态学习的综述文章。 【论文标题】A Survey on Huma…

语音人脸多模态
18 0 0
音频理解大模型四年进展:从 Whisper 到 Qwen3.5-Omni
语音小管家语音小管家
转载3 months ago
音频理解大模型四年进展:从 Whisper 到 Qwen3.5-Omni

以下文章来源于433的3号同学,作者贾彦 一、结论先行 过去四年,音频智能的核心范式发生了五次迁移: 先形成可复用的两类听觉前端。Whisper 提供稳健的语音语义表征,解决“说了什么”;CLAP 提供通用声音—文本对齐,解决“这是什么声音…

音频理解大模型
50 0 0
语音与音频学术速递[7.13]
每日语音速递每日语音速递
原创3 months ago
语音与音频学术速递[7.13]

语音合成语音识别
17 0 0
‹1…1213141516…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8TIOBE 场景测试:经济 金融 货币9语音信号处理论文优选:Handling Background Noise in Neural Speech Generation10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号