语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
语音/音频处理学术速递[12.1]
每日语音速递每日语音速递
原创10 months ago
语音/音频处理学术速递[12.1]

语音合成语音识别
23 0 0
【交我学-18】让机器 “看懂” 声音:AVSR技术如何提升嘈杂环境下语音识别性能
语音小管家语音小管家
转载10 months ago
【交我学-18】让机器 “看懂” 声音:AVSR技术如何提升嘈杂环境下语音识别性能

大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…

语音识别
13 0 0
AAAI 2026|MARS:基于多模态检索和选择增强的对话LLM语音识别
语音小管家语音小管家
转载10 months ago
AAAI 2026|MARS:基于多模态检索和选择增强的对话LLM语音识别

随着以智能助手为代表的人机语音对话系统和会议转录与纪要等应用的爆发,对话语音识别(Conversational ASR) 技术变得愈发重要。对话语音(Conversational Speech)具有高度的上下文(Context)相关性,而擅…

语音识别
23 0 0
NeurIPS 2025|E-BATS:首个无需反向传播的高效语音 Test-Time Adaptation 框架
语音小管家语音小管家
原创10 months ago
NeurIPS 2025|E-BATS:首个无需反向传播的高效语音 Test-Time Adaptation 框架

⏩背景:真实场景中的语音模型为何会“失灵”? 当前的大型语音基础模型(Speech Foundation Models, SFMs),如Wav2Vec2、HuBERT,在干净数据上表现极佳,但在真实世界中经常碰到噪声、口音、麦克风差异等“声…

语音模型
28 0 0
Step-Audio-R1:比肩 Gemini 3 Pro,StepFun 开源首个音频深度推理模型
语音小管家语音小管家
原创10 months ago
Step-Audio-R1:比肩 Gemini 3 Pro,StepFun 开源首个音频深度推理模型

近年来,以思维链(Chain-of-Thought)为代表的扩展推理技术,在文本和视觉领域取得了巨大成功。然而,在音频领域,一个令人困惑的现象始终存在:音频语言模型似乎无法从思维链中受益,甚至表现出“想得越多,错得越多”的“反常缩放”现象。…

音频深度推理模型
20 0 0
JEDIS-LLM — 短音频训练、长音频流式推理解决说话人日志问题
语音小管家语音小管家
转载10 months ago
JEDIS-LLM — 短音频训练、长音频流式推理解决说话人日志问题

论文题目:《Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR And Diarization On Long Audio》 arXiv链接:…

说话人日志
20 0 0
字节联手港中大,打造TTS语音自然度评估系统,让机器懂人类觉得“自然”的语音
语音小管家语音小管家
转载10 months ago
字节联手港中大,打造TTS语音自然度评估系统,让机器懂人类觉得“自然”的语音

标题:《SpeechJudge: Towards Human-Level Judgment for Speech Naturalness》 论文地址:https://arxiv.org/pdf/2511.07931 项目地址:https:/…

语音合成
26 0 0
巨人与清华、西工大发布 “视频 x 音乐” 多模态生成新进展
语音小管家语音小管家
原创10 months ago
巨人与清华、西工大发布 “视频 x 音乐” 多模态生成新进展

多模态生成技术在图像、视频、语音等方向的快速突破,使 “音乐 × 视频” 的多模态生成变成新的研究热点。然而在真实业务场景中,仍然存在诸多未被充分解决的技术空白,例如: 在音乐驱动的视频生成中,仍缺乏对长时序一致性、音画节奏对齐与镜头运动的…

语音合成
17 0 0
语音/音频处理学术速递[11.27]
每日语音速递每日语音速递
原创10 months ago
语音/音频处理学术速递[11.27]

语音合成语音识别
23 0 0
使用Auden-Voice语音编码器同时捕捉说话人身份与副语言信息
语音小管家语音小管家
转载a year ago
使用Auden-Voice语音编码器同时捕捉说话人身份与副语言信息

题目:《Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding》 地址:https://arxiv.org/pdf/2511.1514…

语音编码器
23 0 0
‹1…6364656667…479›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6语音信号处理论文优选:Handling Background Noise in Neural Speech Generation7详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)8TIOBE 场景测试:经济 金融 货币9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号