语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
南洋理工&腾讯最新 Rolling Forcing 解决流视频生成长期误差累积,连贯如一且长达数分钟!
语音小管家语音小管家
转载a year ago
南洋理工&腾讯最新 Rolling Forcing 解决流视频生成长期误差累积,连贯如一且长达数分钟!

论文链接:https://arxiv.org/pdf/2509.25161 项目链接:https://kunhao-liu.github.io/Rolling_Forcing_Webpage/ 图 1:Rolling Forcing 可在单…

大模型
16 0 0
阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!
语音小管家语音小管家
转载a year ago
阿里重磅开源:端到端VLM文档解析模型,图片直出结构化HTML!

在 AI 文字识别类应用的落地过程中,有一个被低估却非常关键的环节:文档解析。 无论是科研、金融、法律,还是教育、医药、制造业,日常处理的海量文档里,总有一大类以 PDF、扫描件、图片的形式存在。 要想把它们转化为 AI 可用的知识,需要先…

大模型
14 0 0
刚刚,LeCun团队开源首款代码世界模型!能像程序员一样思考的LLM来了
语音小管家语音小管家
转载a year ago
刚刚,LeCun团队开源首款代码世界模型!能像程序员一样思考的LLM来了

来源丨新智元 疯狂挖人的Meta,终于在今天发布了最新AI研发成果!代码世界模型CWM是本次发布的模型,创新性地将世界模型引入了代码生成任务中。这是否会成为编程模型新范式? 疯狂挖人的Meta,终于把他们的AI研发新成果端上来了! 就在今天…

大模型
15 0 0
DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?
语音小管家语音小管家
转载a year ago
DeepSeek-V3.1「终极版」重磅发布!最大提升超36%,V4/R2还远吗?

来源丨新智元 DeepSeek最新模型DeepSeek-V3.1-Terminus来了!此前在输出中随机掺入「极」字的问题得到显著缓解,Humanity's Last Exam成绩也较V3.1提升1/3!Terminus这个名字是否在暗示D…

大模型
26 0 0
Stable Audio 2.5丨企业级音频生成AI模型,3分钟曲目2秒钟完成
语音小管家语音小管家
转载a year ago
Stable Audio 2.5丨企业级音频生成AI模型,3分钟曲目2秒钟完成

来源丨AI音频时代 人工智能研究实验室Stability AI正式推出企业级音频生成模型Stable Audio 2.5。也是首款针对企业级用例开发的模型。 Stable Audio 2.5在音频细节处理、生成速度、音乐结构完整性以及功能拓…

大模型
20 0 0
Qwen下一代基础架构突袭!秒解AIME数学竞赛题,提速10倍+性价比提升10倍
语音小管家语音小管家
转载a year ago
Qwen下一代基础架构突袭!秒解AIME数学竞赛题,提速10倍+性价比提升10倍

来源丨量子位 Qwen下一代模型架构,抢先来袭! Qwen3-Next发布,Qwen团队负责人林俊旸说,这就是Qwen3.5的抢先预览版。 基于Qwen3-Next,团队先开源了Qwen3-Next-80B-A3B-Base。 模型参数80…

大模型
14 0 0
CosyVoice TTS 3.0版本,让声音也能有情绪
语音小管家语音小管家
转载a year ago
CosyVoice TTS 3.0版本,让声音也能有情绪

CosyVoice 系列一直是 TTS 领域备受瞩目的标杆之作。从 CosyVoice 1 到如今的 CosyVoice 3,它不仅逐步实现了当前 TTS 技术的主流功能,更在技术架构上实现了全面覆盖与深度优化。近日,CosyVoice 3…

大模型
17 0 0
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
语音小管家语音小管家
转载a year ago
大模型破译甲骨文创下新SOTA!复旦团队推出新框架

来源丨量子位 让大模型破译从未见过的甲骨文,准确率拿下新SOTA! 自复旦大学的研究人员提出了一种基于部首和象形分析的可解释甲骨文破译框架—— 不仅在公开基准数据集HUST-OBC和EV-OBC上,达到最先进的Top-10识别准确率以及优异…

大模型
13 0 0
美团开源 Meeseeks 评测集:揭秘大模型的 “听话”能力
语音小管家语音小管家
转载a year ago
美团开源 Meeseeks 评测集:揭秘大模型的 “听话”能力

来源丨美团技术团队 针对大模型知识推理能力与指令遵循能力存在表现差异的现象,为推进指令遵循能力的系统化研究与精准评估,美团 M17 团队推出全新评测基准 Meeseeks,并在魔搭社区、GitHub、Huggingface等开源平台上线。…

大模型
25 0 0
台大李宏毅与微软合作提出STITCH:能够边说话边深度思考的口语语言模型
语音小管家语音小管家
原创a year ago
台大李宏毅与微软合作提出STITCH:能够边说话边深度思考的口语语言模型

ChatGPT、DeepSeek 等语言模型具备「深度推理」(Reasoning)能力,这类模型会在回答问题前先进行一段较长的推论过程,使回答的品质大幅提升。 不过,这种「先停下来思考再作答」的方式,虽然能产生更高品质的回应,却不太适用于需…

大模型
33 0 0
‹12345…19›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6TIOBE 场景测试:经济 金融 货币7语音信号处理论文优选:Handling Background Noise in Neural Speech Generation8详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)9TIOBE 场景测试:汽车之家 汽车评测10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号