语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
技术漫谈|GPT-Live 之后,我们重新掂量「像人」这件事
语音小管家语音小管家
转载2 months ago
技术漫谈|GPT-Live 之后,我们重新掂量「像人」这件事

两周前 OpenAI 上线GPT-Live,社交媒体上的形容词高度趋同:"像人"、"有温度"、"跟朋友聊天一样"。往前推两个月,Thinking Machines Lab 放出第一批 Interaction Models;同期 xAI 的g…

大模型
45 0 0
腾讯发布 Hy ASR 3.0 preview:通用识别、方言覆盖、场景鲁棒性全面提升
语音小管家语音小管家
转载2 months ago
腾讯发布 Hy ASR 3.0 preview:通用识别、方言覆盖、场景鲁棒性全面提升

来源:机器之心 刚刚,腾讯混元正式发布新一代语音识别模型 Hy ASR 3.0 preview。基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感…

语音识别
41 0 0
语音与音频学术速递[8.4]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[8.4]

语音合成语音识别
43 0 0
欧盟的新AI法现已生效:音频行业从业者需了解的事项
语音小管家语音小管家
转载2 months ago
欧盟的新AI法现已生效:音频行业从业者需了解的事项

以下文章来源:电影声音网 欧盟《人工智能法案》透明度要求已于2026年8月2日生效。 如果你正在使用人工智能对面向欧盟受众的作品进行音频、对话或视频的编辑、修改或生成,那么无论你身处何地,本周末生效的披露规则都将适用。以下是摘要。 01、欧…

资讯
31 0 0
Interspeech2026 | MeanVC 2:面向低延迟与鲁棒性的流式零样本语音转换
语音小管家语音小管家
转载2 months ago
Interspeech2026 | MeanVC 2:面向低延迟与鲁棒性的流式零样本语音转换

零样本语音转换旨在保留语音语言内容的同时,将源说话人音色迁移至任意未见过的目标说话人。随着实时通信、直播互动、在线会议、游戏语音等应用场景的发展,语音转换系统对低延迟、轻量化和高保真流式推理能力提出了更高要求。此前提出的 MeanVC 通过…

语音转换
35 0 0
千问发布 Qwen3.8-Max,2.4 万亿参数,首次开源 Max 级模型
语音小管家语音小管家
转载2 months ago
千问发布 Qwen3.8-Max,2.4 万亿参数,首次开源 Max 级模型

通义千问团队今日正式发布 Qwen 3.8-Max,参数规模达 2.4 万亿(活跃参数 95B),成为 Qwen 家族迄今最强的模型,模型权重将于下周开源。这是 Qwen 首次对 Max 级别模型开放权重。 千问AI平台:https://w…

大模型
37 0 0
语音与音频学术速递[8.3]
每日语音速递每日语音速递
原创2 months ago
语音与音频学术速递[8.3]

语音合成语音识别
32 0 0
全双工口语对话系统综述:架构层级、交互本体与决策状态机(二)
语音小管家语音小管家
原创2 months ago
全双工口语对话系统综述:架构层级、交互本体与决策状态机(二)

以下文章来源于乐百一家 论文题目:A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Dec…

口语对话
36 0 0
模型上新|Qwen-Audio-3.0-Gen-Preview:从"分别生成"到"统一编排"
语音小管家语音小管家
转载2 months ago
模型上新|Qwen-Audio-3.0-Gen-Preview:从"分别生成"到"统一编排"

今天,阿里千问发布Qwen-Audio-3.0-Gen-Preview。它把各类音频元素的生成与编排统一到同一个模型里,只需一段场景描述,就能在同一条时间轴上同时生成多角色对白、环境声、动作音效和背景音,输出可直接使用的成品音轨。 技术报告…

语音合成
40 0 0
字节发布 Seedance 2.5,可单次生成30秒视频
语音小管家语音小管家
转载2 months ago
字节发布 Seedance 2.5,可单次生成30秒视频

来源丨字节跳动Seed 今天,字节发布新一代视频创作模型Seedance 2.5。 Seedance 2.0 发布后,团队观察到,用户对视频创作模型的期待正在从"生成一个片段"走向"完成一段创作"。Seedance 2.5 延续了 Seed…

视频生成
32 0 0
‹1…7891011…314›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6TIOBE 场景测试:经济 金融 货币7语音信号处理论文优选:Handling Background Noise in Neural Speech Generation8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号