标题:A Study Of Data Selection Strategies For Pre-Training Self-Supervised Speech Models 链接:https://arxiv.org/pdf/2601.208…
声浪
近日,由复旦邱锡鹏担任首席科学家的模思智能发布了多说话人自动语音识别(ASR)模型 MOSS-Transcribe-Diarize,不但可以语音转文字,还可以将音频片段与对话中不同的说话者关联起来,性能超过了 GPT-4o、Gemini、豆…
大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…
大家好,欢迎来到「AudioCC交我学」专栏! 作为学术研究者与实践者的连接点,我们致力于打造一个专注于语音技术的学术交流平台——「AudioCC交我学」专栏。在这里,我们将以简洁、专业的视角,解读听觉认知与计算声学领域的前沿论文,分享技术…
标题:《HPSU: A Benchmark for Human-Level Perception in Real-World Spoken Speech Understanding》 链接:https://arxiv.org/pdf/251…
⏩背景:真实场景中的语音模型为何会“失灵”? 当前的大型语音基础模型(Speech Foundation Models, SFMs),如Wav2Vec2、HuBERT,在干净数据上表现极佳,但在真实世界中经常碰到噪声、口音、麦克风差异等“声…
ChatGPT、DeepSeek等语言模型具备「深度推理」(Reasoning)能力,这类模型会在回答问题前先进行一段较长的推论过程,使回答的品质大幅提升。 不过,这种「等使用者说完话才开始思考」的方式,虽然在纯文字的使用场景能够被接受,却…
来源丨AI音频时代 AI语音技术公司ElevenLabs正式宣布将其AI文生音效模型升级至版本2。此次更新在音效生成的时长、质量与可控性三大维度实现跨越式提升,标志着AI音频创作正式迈入“专业可用”阶段。 特点说明 1、即时生成 几秒钟内开…
深圳豹亮(以下简称“豹亮科技”),成立于2020年3月,现有员工人数超过150名,产品年营收10亿+,月流水峰值过2亿,目前专注全球化中度休闲游戏,代表作《三国吧兄弟》,另有数款潜力新游,主要是肉鸽、休闲竞技品类 招聘岗位 语音模型算法实习…
