语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
语音/音频处理学术速递[7.25]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[7.25]

声纹识别语音合成语音识别
28 0 0
OmniAvatar:夸克技术团队 x 浙江大学联合开源,音频驱动全身视频生成模型
语音小管家语音小管家
转载a year ago
OmniAvatar:夸克技术团队 x 浙江大学联合开源,音频驱动全身视频生成模型

近期,夸克技术团队和浙江大学联合开源了OmniAvatar,这是一个创新的音频驱动全身视频生成模型,只需要输入一张图片和一段音频,OmniAvatar即可生成相应视频,且显著提升了画面中人物的唇形同步细节和全身动作的流畅性。此外,还可通过提…

语音合成
15 0 0
语音/音频处理学术速递[7.24]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[7.24]

语音合成语音识别
25 0 0
李沐老师也出手了,教你手搓语音大模型,代码全开源还能在线试玩!
语音小管家语音小管家
转载a year ago
李沐老师也出手了,教你手搓语音大模型,代码全开源还能在线试玩!

来源丨量子位 李沐老师终于带着他的手搓语音大模型教程回归了,一千万小时音频数据训练的TTS,效果秒杀一众商业&开源的TTS。 本期视频不讲论文,李沐老师来手把手教大家怎样玩转他们团队最新研发的Higgs Audio V2模型,不仅能处理文本…

语音合成
25 0 0
影视配乐、游戏音效革命:清华大学 & 生数科技 ACM MM 2025 最新研究让 AI 生成时间可控长时音频
每日语音速递每日语音速递
原创a year ago
影视配乐、游戏音效革命:清华大学 & 生数科技 ACM MM 2025 最新研究让 AI 生成时间可控长时音频

文生音频系统(Text-to-audio generation, T2A)在生成模型的持续发展下取得了显著的进展。然而,由于精确时间对齐的音频-文本数据对在质量和数量上的限制,现有 T2A 系统在面对包含精确时间控制的复杂文本提示时表现仍然…

语音合成
18 0 0
语音/音频处理学术速递[7.23]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[7.23]

语音识别语音合成
26 0 0
ACM MM 2025|DualDub:同时生成和谐的语音与背景音频,构建完整的视频音轨
语音小管家语音小管家
转载a year ago
ACM MM 2025|DualDub:同时生成和谐的语音与背景音频,构建完整的视频音轨

当前视频到音频(Video-to-Audio, V2A)模型可以从视觉输入中生成逼真的背景音频,但它们大多忽略了语音在视频音轨中的关键组成部分。近期,西工大音频语音与语言处理研究组(ASLP@NPU)联合巨人网络、University of…

语音合成
16 0 0
语音/音频处理学术速递[7.22]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[7.22]

语音合成语音识别
21 0 0
MM 2025丨ISDrama:通过多模态提示实现沉浸式空间戏剧生成
语音小管家语音小管家
原创a year ago
MM 2025丨ISDrama:通过多模态提示实现沉浸式空间戏剧生成

多模态沉浸式空间戏剧生成旨在基于多模态提示,创建具有戏剧韵律的连续多说话人双耳语音,在增强现实(AR)、虚拟现实(VR)等领域具有潜在应用。这项任务需要基于多模态输入同时对空间信息和戏剧韵律进行建模,且数据收集成本较高。 为此,浙江大学的学…

语音合成
14 0 0
语音/音频处理学术速递[7.21]
每日语音速递每日语音速递
原创a year ago
语音/音频处理学术速递[7.21]

语音识别语音合成
19 0 0
‹1…4041424344…111›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:经济 金融 货币8语音信号处理论文优选:Handling Background Noise in Neural Speech Generation9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号