Cactus Compute 发布开源语音识别模型 Whistle,面向手机、可穿戴设备、机器人、汽车和微控制器等端侧设备。 模型文件仅 16.9MB,直接在 CPU 上运行,并与其端侧工具调用模型 Needle 共用同一套 C++ 推理引…
声浪
把录音里说错的一个词改过来,让一句话的语气更轻松,或者去掉背景中的狗叫声,同时保留原本的人声和环境声——这些看似简单的要求,正是音频编辑需要解决的问题。 随着音频生成模型的发展,用文字描述一段声音并让模型生成出来,已经有了不少可行方案。但面…
声学智能的前沿探索与青年力量 当语音技术不再只是“听清楚、说出来”,当声音开始与大模型、多模态智能、医疗健康、脑科学、低资源语言深度交叉,我们正在进入一个更加丰富的声学智能时代。 从低码率语音编解码、语音增强与合成,到音频推理、副语言表达与…
语音助手正在从“一问一答”走向跨越多次会话的长期交互。用户上周提过的计划、某位家庭成员说过的话、某次对话时的语气,都可能在之后被问起。但语音里的信息远不止文字:谁说的、怎么说的、背景里有什么声音,都只存在于音频信号里,一旦转成文字就丢失了。…
Edge0 发布 Audio8-ASR-Infinite 预览版,面向中英文实时语音识别,提供 80、120 和 160ms 三档流式音频时钟,并可将转写延迟配置在 240–560ms。 模型原生上下文为 30 秒,但通过滚动 KV 缓存持…
过去一年,OpenAI、Thinking Machines Lab 等多模态团队开始把注意力从「生成更拟人的语音回答」,迈向一个更难的问题:AI 如何真正参与一场实时发生的互动。 全双工模型让智能体边听边说,全模态让语音、视觉等信息协同判断…
虚假音频检测技术日益受到关注,但现有技术仍存在两方面的局限:一是人工模仿音频检测。真人模仿者可复现目标说话人的韵律、音色和风格,与AI合成音频不同,人工模仿音频无明显生成痕迹,对现有检测方法构成严峻挑战。二是可解释性检测。为增强检测可信度,…
IEEE 国际声学、语音与信号处理会议(ICASSP)是 IEEE 信号处理学会的旗舰会议,每年汇聚全球信号处理、人工智能、通信、感知与多媒体等领域的顶尖专家学者,围绕相关议题展开交流与讨论,推动信号处理理论、方法及应用的创新发展。第52届…
近日,蚂蚁集团-大安全机器智能-AI身份智能团队,推出基于混合专家机制(MoE)的声纹识别模型 MECT(Mixture of Experts CNN-Transformer),首次将 MoE 机制引入全监督训练说话人识别领域。在权威基准
中文口语语言处理国际学术会议(International Symposium on Chinese Spoken Language Processing, ISCSLP)是国际语音通信协会中文口语语言处理特别兴趣组(ISCA SIG-CSL…
