来源丨AI音频时代、Renee 创业随笔
近日,ElevenLabs 发布了新一代音乐模型 Music v2,目前已经可以在 ElevenMusic 和 ElevenCreative 中使用。
Stable Audio 3.0刚刚升级后(Stable Audio 3.0 发布),ElevenLabs也发布了他们AI音乐模型的新版,这也是该公司迄今为止在音乐生成领域最重要的一次升级。新模型不仅在音质方面实现显著提升,更在创作控制、编辑能力以及商业化应用层面迈出了关键一步,进一步缩小了 AI 音乐与传统音乐制作流程之间的差距。
这次更新表面上看是一次音乐生成模型的升级,但更重要的是,它代表 AI 音乐正在从“一次性生成”走向“可编辑、可迭代、可控制”的创作系统。

Music v2 这次强化了快速 Rap 和复杂人声的生成能力。过去很多 AI 音乐模型在处理高密度歌词、快速押韵和复杂节奏时,很容易出现吃字、节奏漂移、发音混乱等问题。因为 Rap 本质上不只是旋律生成,而是语言、节奏和时间结构的联合控制。模型不仅要理解歌词,还要把每个音节准确地放进节拍里。


另一个很重要的更新是风格切换。Music v2 可以让一首连续的歌曲从 opera 切换到 heavy metal,再切回来,而且不需要手动拼接。这说明模型开始具备更强的长程结构控制能力。真正的音乐创作难点从来不只是生成一个好听的片段,而是让整首歌在情绪、节奏、主题和风格变化上保持连贯。


我觉得最值得关注的是 improved inpainting。现在用户可以选中一首歌里的某一段,只重新生成这一部分,而不影响其他部分。比如只修改 chorus、重做 bridge,或者微调某一段 vocal。这个能力很关键,因为真实创作很少是一次生成完美结果,更多是不断局部修改、反复试错。


所以这次 Music v2 的意义不只是“音乐质量更好了”,而是 AI 音乐工具开始更接近真实创作流程。生成只是第一步,后面更重要的是编辑、控制和迭代。

ElevenLabs 也越来越不像一家单纯的 TTS 公司,而是在往完整的 Audio Foundation Model 平台发展。从 voice、conversational AI、real-time audio,到 sound generation 和 music generation,它正在把 AI 音频的不同能力逐渐串起来。