AudioEdit:深入探索基础模型时代的音频编辑
原创2 days ago
AudioEdit:深入探索基础模型时代的音频编辑

把录音里说错的一个词改过来,让一句话的语气更轻松,或者去掉背景中的狗叫声,同时保留原本的人声和环境声——这些看似简单的要求,正是音频编辑需要解决的问题。 随着音频生成模型的发展,用文字描述一段声音并让模型生成出来,已经有了不少可行方案。但面…

资讯算法
13 0 0
VoxMem:音频大模型能跨会话记住说话人、语气和环境声吗?
原创4 days ago
VoxMem:音频大模型能跨会话记住说话人、语气和环境声吗?

语音助手正在从“一问一答”走向跨越多次会话的长期交互。用户上周提过的计划、某位家庭成员说过的话、某次对话时的语气,都可能在之后被问起。但语音里的信息远不止文字:谁说的、怎么说的、背景里有什么声音,都只存在于音频信号里,一旦转成文字就丢失了。…

资讯算法
18 0 0
EvoAudio:让音频大模型在“听力训练”中自进化
原创5 days ago
EvoAudio:让音频大模型在“听力训练”中自进化

同一句话播放两遍,内容一模一样,只是第二遍音调更高,让它挑出音调更高的那一遍。能把语音转写准确的模型,未必答得好这样的题。类似的问题还有:一段对话里有几位说话人?一段音乐的节奏有没有加快?这些任务都在提醒我们:知道“说了什么”,不等于听懂声…

算法学术
15 0 0