由阶跃星辰和ACE Studio联合发布的开源音乐生成模型ACE-Step 1.5,制作一首商业歌曲仅需 2-10 秒。

ACE-Step 1.5能“一人”包揽从创作端的作词、作曲、编曲,到制作端的制作人、录音师、混音师、母带师,再到前台歌手、若干和声和乐手等等工作。
开源一个月以来,收到来自开发者社区的热烈反馈。不仅在 X 上积累超过 100 万曝光量,同时拿下HuggingFace Space Trending 榜一,GitHub Star 超过 6.8K。

包括 Stability AI 创始人Emad在内的很多圈内大佬都给予高度评价。以及 ComfyUI、MLX 作者在内的大量开发者也为 ACE-Step 1.5 开发 UI、进行本地部署支持等。


ACE-Step 1.5 可在本地运行,显存占用低于 4GB,并支持轻量级个性化:用户仅需少量歌曲即可训练一个 LoRA(Low-Rank Adaptation,低秩适配,是一种用于高效微调大模型的技术,核心目标是在不大幅增加参数量和显存占用的情况下,让模型学会新的风格、任务或偏好),用于捕捉并复现个人风格。
在常用的评估指标上,ACE-Step 1.5 的质量超过了大多数商业音乐模型。在 CU 内容可理解性、 Coh.连贯性、Mus.音乐性、Mem.记忆度、Cla.清晰度、Nat.自然度六大指标上得分第一。

同时 ACE-Step 1.5的生成速度极快——在 A100 上每首完整歌曲生成时间不到 2 秒,在 RTX 3090 上不到 10 秒。这个速度比同级别产品快了 10-120 倍。

🎰模型架构
ACE-Step 1.5 的核心是一种新型的混合架构:语言模型(LM)作为全能规划器,将用户的文本请求转化为完整的歌曲蓝图 —— 可覆盖从一个较短的循环片段到 10 分钟长度的完整音乐作品创作,同时通过思维链(Chain-of-Thought) 生成元数据、歌词和描述文本,以此引导扩散 Transformer(DiT)。

也就是说 ACE-Step 1.5 能够将语言模型的规划能力与扩散 Transformer 的生成能力结合,实现 “懂指令 + 会创作” 的双重优势。
👾音乐创作功能
DiT 是 ACE-Step 1.5 核心的音频生成模块,根据LM语言模型提供的蓝图,执行从 “无到有”“局部修改”“音轨操作” 等多种音乐创作任务:
Text2Music 文本生成音乐——用户输入文本描述,DiT 从零开始生成一首完整的音乐;
Cover 翻唱、重制、完整改编——基于已有歌曲,重新生成一版(如风格改编、翻唱),保留核心旋律但重塑质感;
Repaint 局部重制、改编——对已有音乐的局部进行修改(如改副歌、换一段旋律),其他部分保持原样;
Extract Track 提取音轨——从完整音乐中分离出某一轨,实现 “人声分离”“乐器提取”;
Add Layer 乐高式叠加——像搭乐高一样,在已有音乐上叠加新的音轨(如加贝斯、弦乐),丰富编曲;
Complete 补全制作——根据已有单音轨(如人声),自动补全伴奏、编曲,形成完整歌曲。

🎧上手体验
登录官网 acemusic.ai/ 体验 ACE-Step 1.5 的功能。或者通过以下方式详细了解 ACE-Step 1.5 并进行本地部署:
