语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
ChinaVoices Challenge 中文多方言语音识别挑战赛结果正式揭晓
语音小管家语音小管家
转载2 months ago
ChinaVoices Challenge 中文多方言语音识别挑战赛结果正式揭晓

从赛事启动、数据发布,到公开评测、隐藏评测与系统复核,ChinaVoices Challenge 2026 中文多方言语音识别挑战赛现已圆满完成各项赛程。经过组委会对参赛结果、系统材料与合规情况的综合核验,赛事最终结果于近日正式发布! 本届…

语音识别赛事
33 0 0
语音与音频学术速递[7.28]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[7.28]

语音合成语音识别
28 0 0
9.36M 参数做出顶级 TTS:Inflect v2,人声盲听66%胜率
语音小管家语音小管家
转载2 months ago
9.36M 参数做出顶级 TTS:Inflect v2,人声盲听66%胜率

以下文章来源:努力犯错玩AI 近日,独立开发者 Owen Song 发布了 Inflect v2。这是一个极致轻量的英文语音合成模型。Micro 版只有 9.36M 参数,FP32 权重只有 37.5MB。Nano 版更是只有 3.97M…

语音合成
53 0 0
εar-VAE:回归听觉感知的高保真音乐重建
语音小管家语音小管家
原创2 months ago
εar-VAE:回归听觉感知的高保真音乐重建

良好的音频生成范式大概的确需要 latent。待压缩的音频无论取 patch 还是 STFT,从无到有的新 dim,本质上都承担着时域压缩的功能;但音频在不同时间尺度下有无法归纳的 semantic 周期,在频域做 polar 或原始 co…

音乐重建
29 0 0
语音与音频学术速递[7.27]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[7.27]

语音合成语音识别
36 0 0
ACM MM 2026 :全类型音频深度伪造检测
语音小管家语音小管家
转载2 months ago
ACM MM 2026 :全类型音频深度伪造检测

近日,IIP-HCI实验室关于全类型音频深度伪造检测的最新研究成果被多媒体领域顶级国际会议 ACM MM 2026 接收。会议全称为 ACM International Conference on Multimedia,自1993年创办以来…

音频深度伪造检测
25 0 0
TF-MossFormer:在单通道语音分离中同时捕捉“局部细节”与“全局依赖”
语音小管家语音小管家
转载3 months ago
TF-MossFormer:在单通道语音分离中同时捕捉“局部细节”与“全局依赖”

来源丨阿里语音AI 近年来,单通道语音分离技术犹如一场精彩的接力赛,从 Conv-TasNet 的精巧卷积,DPRNN 的深度循环,到 SepFormer 和 MossFormer 的 Transformer 革命,再到 TF-GridNe…

33 1 0
语音与音频学术速递[7.24]
每日语音速递每日语音速递
原创3 months ago
语音与音频学术速递[7.24]

语音合成语音识别
25 0 0
刚刚,Claude爆改语音!11种语言,就是没中文
语音小管家语音小管家
转载3 months ago
刚刚,Claude爆改语音!11种语言,就是没中文

来源丨新智元 刚刚,Anthropic和OpenAI同时放出了语音模式大升级! Claude这边,从只能跑Haiku升级到Opus 4.8和Sonnet 5全系列,不仅能在对话里调Gmail、日历、Slack,还扩增到11种语言,但没有中文…

语音合成
38 0 0
语音与音频学术速递[7.23]
每日语音速递每日语音速递
原创3 months ago
语音与音频学术速递[7.23]

语音识别语音合成
24 0 0
‹1…910111213…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:汽车之家 汽车评测8TIOBE 场景测试:经济 金融 货币9语音信号处理论文优选:Handling Background Noise in Neural Speech Generation10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号