合成媒体初创公司Stability AI发布了其文本转音乐模型的升级版本。新的Stable Audio 2能够根据书面提示生成长达三分钟的音乐曲目,并且该工具还包含其他新功能。

Stable Audio 2增强了9月份发布的原始Stable Audio模型,该公司声称该模型是第一个商业上可行的生成人工智能音乐创作工具。两次迭代都利用了潜在扩散技术,但稳定音频表现更好,并融入了新功能。音频到音频提示是这些新功能之一。该工具允许用户上传音频样本,并根据书面提示通过人工智能引擎将其处理成不同类型的声音。还有更多用于创建音效的选项以及以不同风格再现音频样本的选项。音效增强包括各种偶然的和环境的声音,无论是手指敲击键盘的声音、人群的欢呼声还是音乐会外的城市声音。
“我们最先进的音频模型以其新功能扩展了艺术家和音乐家的创意工具包。通过文本转音频和音频转音频提示,用户可以制作旋律、背景音轨、主干和声音效果,从而增强创作过程。”Stability AI在博客文章中解释道。“Stable Audio 2.0与其他最先进的模型不同,它可以生成长度长达三分钟的歌曲,并配有结构化的作品,包括前奏、展开和结尾,以及立体声音效。”
改进后的模型旨在提供清晰的结构和高品质的声音。它将复杂的音频波形简化为更短、更易于管理的形式,然后重塑它们以创作试图捕捉人类作品精髓的音乐。人工智能的目标是掌握音乐的细微差别,以便复制模式和序列。Stable Audio 2在包含超过800,000条音频的数据库上进行了训练,其中包括音乐曲目、音效和单个乐器声音,所有这些都进行了详细分类和描述。为了解决潜在的版权问题,Stability AI与Audible Magic合作,这是一家专门实时识别和阻止版权内容的公司。该工具可在Stability AI的网站上找到,并将很快嵌入到Stable Audio API中。

信息源于:voicebot