语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
Nes2Net:轻量级嵌套架构,驱动基于语音大模型的深度伪造检测
语音小管家语音小管家
原创a year ago
Nes2Net:轻量级嵌套架构,驱动基于语音大模型的深度伪造检测

随着语音领域生成式人工智能与音频伪造技术的迅猛发展,语音深度伪造(Deepfake),也称为语音反欺骗(Anti-spoofing),已成为信息安全领域的重要挑战。与此同时,基于语音大模型(如wav2vec 2.0 [1]、WavLM [2…

深度伪造检测大模型
18 0 0
合成数据也能通吃真实世界?首个融合重建-预测-规划的生成式世界模型AETHER开源
语音小管家语音小管家
原创a year ago
合成数据也能通吃真实世界?首个融合重建-预测-规划的生成式世界模型AETHER开源

近日,上海人工智能实验室(上海 AI 实验室)开源了生成式世界模型 AETHER。该模型全部由合成数据训练而成,不仅在传统重建与生成任务中表现领先,更首次赋予大模型在真实世界中的 3D 空间决策与规划能力,可助力机器人完成目标导向的视觉规划…

语音合成大模型
14 0 0
字节开源智能体模型 UI-TARS-1.5,全面达到SOTA
语音小管家语音小管家
转载a year ago
字节开源智能体模型 UI-TARS-1.5,全面达到SOTA

昨天字节开源多模态智能体 UI-TARS-1.5,这是一款基于视觉-语言模型构建的开源多模态智能体,能够在虚拟世界中高效执行各类任务。 GitHub:https://github.com/bytedance/UI-TARS Website:…

大模型
11 0 0
海豚语言被谷歌大模型破译!跨物种交流大门打开,哈萨比斯:下一个是狗
语音小管家语音小管家
转载a year ago
海豚语言被谷歌大模型破译!跨物种交流大门打开,哈萨比斯:下一个是狗

量子位 | 公众号 QbitAI 神奇!人类和海豚真的能实现跨物种交流了?当地时间4月14日(也是世界海豚日),谷歌CEO皮猜激动官宣: 隆重推出DolphinGemma,基于多年积累的海豚声音数据训练而成,有助于实现跨物种交流。 划重点,…

大模型
11 0 0
合成数据助力视频生成提速8.5倍,上海AI Lab开源AccVideo
语音小管家语音小管家
转载a year ago
合成数据助力视频生成提速8.5倍,上海AI Lab开源AccVideo

虽然扩散模型在视频生成领域展现出了卓越的性能,但是视频扩散模型通常需要大量的推理步骤对高斯噪声进行去噪才能生成一个视频。这个过程既耗时又耗计算资源。例如,HunyuanVideo [1] 需要3234 秒才能在单张 A100 上生成 5 秒…

大模型
10 0 0
200B参数击败满血DeepSeek-R1,字节豆包推理模型Seed-Thinking-v1.5要来了
语音小管家语音小管家
转载a year ago
200B参数击败满血DeepSeek-R1,字节豆包推理模型Seed-Thinking-v1.5要来了

字节跳动豆包团队今天发布了自家新推理模型Seed-Thinking-v1.5的技术报告。从报告中可以看到,这是一个拥有 200B 总参数的 MoE 模型,每次工作时会激活其中 20B 参数。其表现非常惊艳,在各个领域的基准上都超过了拥有 6…

大模型
12 0 0
最新开源模型DeepCoder,媲美OpenAI-o3,训练方法、数据集大公开
语音小管家语音小管家
原创2 years ago
最新开源模型DeepCoder,媲美OpenAI-o3,训练方法、数据集大公开

来源丨AIGC开放 社今日,AI界突现开源重磅——Together AI与Agentica全面开源DeepCoder-14B-Preview,不仅开放模型权重,更罕见公开了完整训练数据、方法及优化细节。 开源地址:https://huggi…

大模型
9 0 0
Llama 4爆料大反转,没在测试集上训练!华人员工实名辟谣,LeCun出面救火
语音小管家语音小管家
转载2 years ago
Llama 4爆料大反转,没在测试集上训练!华人员工实名辟谣,LeCun出面救火

来源丨新智元 近日,关于Meta Llama 4的「训练作弊」爆料搞得沸沸扬扬。Meta迅速反击,Licheng Yu、Di Jin及GenAI负责人Ahmad Al-Dahle接连辟谣,首席AI科学家Yann LeCun也亲自下场力挺。与…

大模型
11 0 0
港大&华为诺亚提出扩散语言模型:Dream-7B,性能媲美DeepSeek-V3-671B
语音小管家语音小管家
转载2 years ago
港大&华为诺亚提出扩散语言模型:Dream-7B,性能媲美DeepSeek-V3-671B

语言是离散的,所以适合用自回归模型来生成;而图像是连续的,所以适合用扩散模型来生成。在生成模型发展早期,这种刻板印象广泛存在于很多研究者的脑海中。 👆扩散语言模型展示👆 但最近,这种印象正被打破。更多的研究者开始探索在图像生成中引入自回…

大模型
9 0 0
Dolphin:支持东方40语种+中国22方言的新SOTA开源语音大模型
语音小管家语音小管家
原创2 years ago
Dolphin:支持东方40语种+中国22方言的新SOTA开源语音大模型

在当今数字化时代,语音识别技术已成为人机交互的关键桥梁,广泛应用于智能客服、语音助手、会议转录等众多领域。然而,对于东方语言的识别如越南语、缅甸语等,现有模型往往表现不佳,难以满足用户的需求。为解决这一难题,海天瑞声携手清华大学电子工程系语…

大模型
18 0 0
‹1…678910…19›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6TIOBE 场景测试:经济 金融 货币7语音信号处理论文优选:Handling Background Noise in Neural Speech Generation8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号