Cactus Compute 开源 16.9MB 语音识别模型 Whistle
原创a day ago
Cactus Compute 开源 16.9MB 语音识别模型 Whistle

Cactus Compute 发布开源语音识别模型 Whistle,面向手机、可穿戴设备、机器人、汽车和微控制器等端侧设备。 模型文件仅 16.9MB,直接在 CPU 上运行,并与其端侧工具调用模型 Needle 共用同一套 C++ 推理引…

开源资讯
19 0 0
AudioEdit:深入探索基础模型时代的音频编辑
原创2 days ago
AudioEdit:深入探索基础模型时代的音频编辑

把录音里说错的一个词改过来,让一句话的语气更轻松,或者去掉背景中的狗叫声,同时保留原本的人声和环境声——这些看似简单的要求,正是音频编辑需要解决的问题。 随着音频生成模型的发展,用文字描述一段声音并让模型生成出来,已经有了不少可行方案。但面…

资讯算法
15 0 0
VoxMem:音频大模型能跨会话记住说话人、语气和环境声吗?
原创4 days ago
VoxMem:音频大模型能跨会话记住说话人、语气和环境声吗?

语音助手正在从“一问一答”走向跨越多次会话的长期交互。用户上周提过的计划、某位家庭成员说过的话、某次对话时的语气,都可能在之后被问起。但语音里的信息远不止文字:谁说的、怎么说的、背景里有什么声音,都只存在于音频信号里,一旦转成文字就丢失了。…

资讯算法
20 0 0
ICASSP 2027丨ADD 2026国际挑战赛开放报名
公告16 days ago
ICASSP 2027丨ADD 2026国际挑战赛开放报名

虚假音频检测技术日益受到关注,但现有技术仍存在两方面的局限:一是人工模仿音频检测。真人模仿者可复现目标说话人的韵律、音色和风格,与AI合成音频不同,人工模仿音频无明显生成痕迹,对现有检测方法构成严峻挑战。二是可解释性检测。为增强检测可信度,…

32 0 0
ICASSP 2027丨赛事合集
原创17 days ago
ICASSP 2027丨赛事合集

IEEE 国际声学、语音与信号处理会议(ICASSP)是 IEEE 信号处理学会的旗舰会议,每年汇聚全球信号处理、人工智能、通信、感知与多媒体等领域的顶尖专家学者,围绕相关议题展开交流与讨论,推动信号处理理论、方法及应用的创新发展。第52届…

28 0 0