语音之家
首页声浪活动AI科普学堂SOTA分享热聘会员服务
登录 注册

声浪

写文章
十万级热词也能稳住:面向工业落地的 LLM-ASR 上下文偏置方案
语音小管家语音小管家
原创9 months ago
十万级热词也能稳住:面向工业落地的 LLM-ASR 上下文偏置方案

基于热词检索与强化学习的 LLM-ASR 上下文偏置新框架。 论文:Contextual Biasing for LLM-based ASR with Hotword Retrieval and Reinforcement Learning…

语音识别LLM
42 0 0
阶跃星辰发布首个开源 LLM 级音频编辑大模型 Step-Audio-EditX
语音小管家语音小管家
转载a year ago
阶跃星辰发布首个开源 LLM 级音频编辑大模型 Step-Audio-EditX

来源丨魔塔modelscope社区 近期,阶跃星辰发布了全球首个开源 LLM 级音频编辑大模型 —— Step-Audio-EditX。 该模型能够通过语言指令或迭代方式,精准控制音频的情感、说话风格和副语言特征,并实现零样本文本转语音(Z…

LLM
12 0 0
语音大模型综述:全面解读口语语音大模型(SLM)的发展历程与未来挑战
语音小管家语音小管家
转载a year ago
语音大模型综述:全面解读口语语音大模型(SLM)的发展历程与未来挑战

前言:今天arxiv发消息,CS板块不再接收未经同行评审的综述类文章,不好评论,只记得十年前,综述都是顶刊邀请,IEEE Fellow坐镇,再加上几个Senior,几年才有一篇,当宝贝一样来回读,近几年综述是挺多的。。。以后既然不再接收新的…

LLM
18 0 0
ICML 2025丨上交大跨媒体语言智能实验室2篇录用论文分享
语音小管家语音小管家
转载a year ago
ICML 2025丨上交大跨媒体语言智能实验室2篇录用论文分享

ICML(International Conference on Machine Learning)是机器学习领域的顶级学术会议之一,由国际机器学习学会(IMLS)主办,被中国计算机学会认定为A类会议。会议涵盖了机器学习的各个前沿方向,包括…

LLM
17 0 0
长文本+o1?评估LLM在真实世界长文本多任务中的深度理解与推理能力
语音小管家语音小管家
转载2 years ago
长文本+o1?评估LLM在真实世界长文本多任务中的深度理解与推理能力

来源丨PaperWeekly 清华大学和智谱的研究团队推出了 LongBench 的第二代——LongBench v2,一个专为评估大模型在真实世界长文本多任务中的深度理解和推理能力而设计的基准测试。

LLM
8 0 0
Meta开源Llama3.3-70B:大模型后训练佳作,400万美元训练成本,性能接近4050亿参数的Llama3.1-405B
语音小管家语音小管家
转载2 years ago
Meta开源Llama3.3-70B:大模型后训练佳作,400万美元训练成本,性能接近4050亿参数的Llama3.1-405B

近期,Meta开源了最新的Llama3.3-70B模型,这是Llama3.3系列目前唯一开源的模型。尽管该模型的参数规模仅仅700亿,但是在多项评测基准上已经超过了4050亿参数规模的Llama3.1-405B,后者是Llama系列模型中参…

LLM
5 0 0
LLM最大能力密度100天翻一倍!清华刘知远团队提出Densing Law
语音小管家语音小管家
转载2 years ago
LLM最大能力密度100天翻一倍!清华刘知远团队提出Densing Law

来源丨机器之心 支持大模型一路狂飙的 Scaling Law 到头了? 近期,AI 圈针对 Scaling Law 是否到头产生了分歧。一派观点认为 Scaling Law 已经「撞墙」了,另一派观点(如 OpenAI CEO Sam Al…

LLM
6 0 0
clone-voice:一键克隆声音,开源AI技术让声音创作更便捷、更个性化
语音小管家语音小管家
转载2 years ago
clone-voice:一键克隆声音,开源AI技术让声音创作更便捷、更个性化

clone-voice是一款免费开源的声音克隆工具,它凭借先进的人工智能技术,能够分析和模拟人类声音的特征,从而实现高质量的声音克隆. 只需提供一段简短的音频样本,它就可以根据该样本生成与原始声音极其相似的克隆声音,并且支持多种语言,目前包…

LLM
7 0 0
微软提出TS3-Codec — 突破卷积束缚,全面拥抱Transformer-only Codec
语音小管家语音小管家
原创2 years ago
微软提出TS3-Codec — 突破卷积束缚,全面拥抱Transformer-only Codec

Neural audio codecs (NACs) 已成为音频压缩和语音语言模型(SLM)表示的关键技术,近年来得到了极大的发展。 微软提出TS3-Codec,为codec模型设计提供了崭新的思路。它是首个完全基于 Transformer…

LLM
9 0 0
AI语音独角兽ElevenLabs发布类似NotebookLM功能,挑战谷歌AI生成播客
语音小管家语音小管家
转载2 years ago
AI语音独角兽ElevenLabs发布类似NotebookLM功能,挑战谷歌AI生成播客

来源丨 Z Potentials 语音人工智能初创公司 ElevenLabs 近期推出了一项功能,允许用户上传不同类型的内容,创建一个多语音播客,类似于Google 的 NotebookLM。 该功能称为 GenFM,可以在公司的 Elev…

LLM
8 0 0
‹123›

热门主题

1资讯
2SpeechIO
3WeNet
4Kaldi
5AudioCC
6算法
7开源
8数据
9学术
10内推招聘

热文排行

1英伟达CPU问世:ARM架构,对比x86实现十倍性能提升2微软拟斥资 160 亿美元收购全球最大语音识别公司 Nuance3ImageNet验证集6%的标签都是错的,MIT:十大常用数据集没那么靠谱4WeNet更新:支持 CTC alignment52021全国声学大会语言声学分论坛报告—第三代语音识别技术初探6详解 WebRTC 高音质低延时的背后 — AGC(自动增益控制)7TIOBE 场景测试:经济 金融 货币8TIOBE 场景测试:汽车之家 汽车评测9语音信号处理论文优选:Handling Background Noise in Neural Speech Generation10推出 Lyra:用于语音压缩的新型极低比特率编解码器

活跃用户榜

语音小管家
语音小管家
已发表 3000 篇
每日语音速递
每日语音速递
已发表 991 篇
西工大音频语音与语言处理研究组
西工大音频语音与语言处理研究组
已发表 106 篇
SpeechIO
SpeechIO
已发表 82 篇
低调奋进
低调奋进
已发表 57 篇
机器之心
机器之心
已发表 45 篇
新智元
新智元
已发表 39 篇
阿里语音AI
阿里语音AI
已发表 33 篇
新一代Kaldi
新一代Kaldi
已发表 31 篇
THUHCSI人机语音交互实验室
THUHCSI人机语音交互实验室
已发表 29 篇

语音之家 SpeechHome

汇聚产学研各界开发者,覆盖语音识别、音频合成、声纹识别、视听多模态、物理 AI、具身听觉、人机交互等方向。

友情链接

中国计算机学会中国人工智能产业发展联盟中国人工智能学会魔搭社区希尔贝壳开源中国思否稀土掘金RTE开发者社区CSDNAI光影社 WeNetopenslrMongoDB中文社区

资源

声浪 活动 AI科普 分享 热聘 会员服务

关于

服务条款 隐私协议 合作伙伴

© 2026 语音之家 SpeechHome.com|京ICP备17027745号-4|京公网安备11010802032971号