AI 生成音乐有两条路:一条是 Suno/ElevenLabs 的 SaaS 快路线,打开网页输 prompt,十几秒出歌,付费可商用;另一条是 ACE-Step 的本地免费路线,MIT 开源,拉到自己机器上跑,不订阅、不按次计费。选错路线等于白做--要商用却用了 Suno 免费档(带水印禁商用),或要免费却买了 Suno 订阅(其实 ACE-Step 本地跑零费用)。
这套 SOP 五步流程:需求与歌词 -> 选工具 -> 生成 -> 后期 -> 整合。与本批 ACE-Step 开源项目解析(本地模型深入)、AI 音乐生成工具横评(五款工具对比)互补:那两篇解决「选什么、为什么」,这篇解决「怎么动手做」。ACE-Step 命令据官方 GitHub README 核实,Suno/ElevenLabs 以官网为准。与本站 AI 播客制作 SOP 划清地盘--这篇是音乐生成(词曲),播客 SOP 是 TTS 语音。
一、两条路线:SaaS 快 vs 本地免费
核心决策在动手前就定了:你要快和省心,还是要免费和可控。
| 维度 | SaaS 快路线(Suno/ElevenLabs) | 本地免费路线(ACE-Step) |
|---|---|---|
| 代表工具 | Suno($8-10/mo)/ ElevenLabs Music(Free-$99) | ACE-Step(MIT 开源,12158★) |
| 费用 | 订阅制,免费档禁商用 | 软件免费,电费自付 |
| 硬件 | 浏览器即可 | 需 GPU(Mac/AMD/Intel/CUDA) |
| 便利性 | 打开网页一键生成 | 装环境、拉模型、调参 |
| 商用权 | 付费方案授予 | MIT 许可,可商用 |
| 可控性 | 闭源,不可改 | 开源,可改可二次开发 |
| 生成速度 | 十几秒出歌 | A100 上 20 秒出 4 分钟音乐 |
一句话:快速出稿或付费商用 -> Suno/ElevenLabs;免费或可商用且愿折腾 -> ACE-Step 本地。
二、SOP 五步流程
Step 1:需求与歌词
动手前先定四件事:
风格。 流行、电子、民谣、嘻哈、R&B?风格直接决定喂给 Suno 的 tag 和 ACE-Step 的 prompt。越具体越好--「90 年代港风流行」比「流行」出片率高。
BPM 与时长。 节拍数(BPM)和时长决定节奏和结构。Suno 支持设定时长(通常 1-4 分钟),ACE-Step 可生成最长 4 分钟的片段。配视频的 BPM 要和画面节奏对齐。
人声或纯音乐。 要带人声的完整歌曲(词+曲+唱),还是纯器乐 BGM?Suno 和 ACE-Step 都能生成人声,ElevenLabs Music 也支持人声。纯器乐需求可以看本站 AI 音乐生成横评 里的 Stable Audio。
歌词与版权。 AI 生成的歌词版权归属目前法律灰区--多数平台条款规定生成内容归用户,但训练数据的版权诉讼(Suno/Udio 被 RIAA 起诉)尚未定论。商用前:别用知名歌曲的歌词做 prompt(可能侵权),别默认「AI 生成等于无版权风险」,读平台最新条款。
Step 2:选工具
按三个维度分叉:
商用权。 要商用 -> Suno/ElevenLabs 付费方案(付费授商用权)或 ACE-Step(MIT 可商用)。Suno 免费档 50 credits/天带水印且禁商用,别拿免费档做商用内容。
成本。 零预算加有 GPU -> ACE-Step 本地跑,软件免费只烧电费。零预算加无 GPU -> Suno 免费档试水(个人非商用)。有预算 -> Suno $8-10/mo 或 ElevenLabs Music 订阅,便利性和质量更稳。
质量与可控性。 要最高便利性和经过商业打磨的质量 -> Suno。要模型在手里可改可二次开发 -> ACE-Step。详细选型对比见本批 AI 音乐生成工具横评。
Step 3:生成
SaaS 路线(Suno): 打开 suno.com,输入 prompt(风格描述加歌词),点生成。Suno v4.5 支持自定义歌词、风格 tag、人声或纯音乐切换。示例 prompt:
Style: 90s Hong Kong pop, male vocal, melancholic
Lyrics:
[Verse 1]
城市灯火渐暗
[Chorus]
...生成耗时约十几秒到一分钟,产出带人声的完整歌曲。免费档每天 50 credits(带水印、禁商用),Pro $10/mo 起。
本地路线(ACE-Step): 按 GitHub README 核实的命令跑。先装环境:
# 1. 克隆仓库
git clone https://github.com/ace-step/ACE-Step.git
cd ACE-Step
# 2. 创建 Python 3.10 环境(conda 或 venv 二选一)
conda create -n ace_step python=3.10 -y
conda activate ace_step
# 或用 venv:python -m venv venv && source venv/bin/activate # Windows: venv\Scripts\activate.bat
# 3. 装 PyTorch(CUDA 12.6 示例,Mac 用 MPS 不需要这步)
pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
# 4. 装 ACE-Step
pip install -e .启动 Gradio 网页界面:
acestep --port 7865或带参数启动(指定模型路径、设备、bf16 精度):
acestep --checkpoint_path /path/to/checkpoint --port 7865 --device_id 0 --share true --bf16 true打开浏览器访问 http://localhost:7865,在界面里输入 prompt(风格描述加歌词),点生成。ACE-Step 在 A100 上约 20 秒生成 4 分钟音乐,RTX 4090 约 1.74 秒生成 1 分钟音频(27 步),MacBook M2 Max 约 26 秒生成 1 分钟音频。性能参考官方 README,以你的实际硬件为准。
Step 4:后期(混音/修音/人声处理)
AI 生成的音乐通常需要后期处理才能用于正式发布。三件事:
混音。 AI 生成的人声和伴奏常混在一起,动态范围不均。用 Audacity(免费开源)或 Reaper 做均衡(EQ)、压缩(Compressor)、限幅(Limiter),让整体音量均衡。
修音。 AI 人声的音准和节奏可能有偏差。用开源工具如 AudioShake 或 iZotope RX(付费)做人声分离和修音。ACE-Step 支持 lyric2vocal(歌词转人声)和 singing2accompaniment(人声转伴奏),可以单独导出人声轨和伴奏轨分别处理。
人声处理。 加混响(Reverb)、延迟(Delay)、和声(Harmony)让人声更有空间感。Audacity 内置基础效果器,专业级用 Reaper 或 Logic Pro。
Step 5:整合(配视频/播客/内容)
按目标场景导出:
配视频。 短视频用 MP3/AAC 192kbps,长视频用 WAV 无损。BPM 和画面节奏对齐(剪辑软件里踩点)。注意音量标准化(-14 LUFS 适合流媒体,-16 LUFS 适合短视频)。
配播客。 做 BGM 或片头片尾曲,导出 MP3 128-192kbps。和播客人声轨混音时 BGM 降 -20dB 以下避免压人声。本站 AI 播客制作 SOP 讲的是 TTS 语音那条线,本文是音乐生成,两者互补。
内容分发。 上 Spotify/Apple Music 需通过 DistroKid 等发行商,格式 WAV 44.1kHz/16bit。商用前确认版权链路清晰(付费方案授商用权或 MIT 许可)。
三、五个踩坑
坑 1:免费档禁商用,拿去商用被追责 Suno 免费档 50 credits/天带水印且明确禁商用,ElevenLabs 免费档同样有限制。拿免费档生成的音乐做商业视频、上架流媒体、接广告,违反条款可能被追责。修法:商用就买付费方案(Suno $8-10/mo 起),或走 ACE-Step 本地路线(MIT 可商用)。别抱侥幸心理。
坑 2:歌词版权灰区,AI 生成不等于无风险 用知名歌曲的歌词做 prompt 让 AI 重新演唱,可能侵犯原词版权。AI 生成的歌词虽然多数平台条款归用户,但训练数据版权诉讼(Suno/Udio 被 RIAA 起诉)未定论。修法:别用受版权保护的歌词做 prompt,商用前读平台最新条款,必要时咨询法律意见。
坑 3:质量不稳定,同 prompt 不同结果 AI 音乐生成有随机性,同一 prompt 跑两次结果可能差很多--一次惊艳一次难听。Suno 和 ACE-Step 都有这个问题。修法:多跑几次取最优;Suno 用免费额度试参数再正式跑;ACE-Step 调整采样步数(27 步快、60 步精)和随机种子。
坑 4:人声和伴奏混在一起,没法单独调 Suno 免费档生成的歌曲人声和伴奏合在一个音频文件里,没法单独调人声或换伴奏。修法:用 Audacity 的人声分离功能(效果一般),或用专业工具如 iZotope RX、AudioShake 做音轨分离。ACE-Step 支持 lyric2vocal 和 singing2accompaniment,可以分开生成人声轨和伴奏轨,后期灵活度更高。
坑 5:导出格式与目标平台不匹配 短视频平台要 MP3/AAC,流媒体要 WAV 44.1kHz/16bit,游戏引擎要 OGG。AI 工具默认导出的格式不一定对。修法:导出前确认目标平台要求的格式和码率,用 Audacity 或 ffmpeg 做格式转换。音量也要按平台标准标准化(流媒体 -14 LUFS,短视频 -16 LUFS)。
常见问题
Q1:Suno 免费档能商用吗? A1:不能。Suno 免费档每天 50 credits,生成的音乐带水印且明确禁止商用。商用需购买付费方案(Pro $10/mo 起授予商用权),或走 ACE-Step 本地路线(MIT 许可可商用)。别拿免费档做商业内容。
Q2:ACE-Step 本地跑需要什么硬件? A2:需要 GPU。官方 README 支持 Mac(Apple Silicon MPS)、AMD、Intel、CUDA 四类设备。CPU 不可用。显存或统一内存通常 8GB 起步。性能参考:RTX 4090 约 1.74 秒生成 1 分钟音频,MacBook M2 Max 约 26 秒。没 GPU 的机器走 Suno 更实际。
Q3:AI 生成的歌词版权归谁? A3:法律灰区。多数平台条款规定生成内容归用户,但训练数据版权诉讼(Suno/Udio 被 RIAA 起诉)尚未定论。别用受版权保护的歌词做 prompt,商用前读平台最新条款。ACE-Step 的 MIT 许可覆盖代码和模型,但生成内容的版权仍需自行判断。
Q4:Suno 和 ACE-Step 怎么选? A4:看商用、成本、可控性。要快和省心、付费商用选 Suno。要免费、可商用、愿折腾环境选 ACE-Step 本地。常见组合:Suno 做快速 demo 和灵感探索,ACE-Step 做批量生成和深度定制。详细对比见本批 AI 音乐生成工具横评。
Q5:这篇和 AI 播客制作 SOP 有什么区别? A5:这篇是音乐生成(词曲创作),用 Suno 或 ACE-Step 生成带人声的完整歌曲或纯器乐。播客 SOP 是 TTS 语音(文本转语音),用 ElevenLabs 等工具把文字念出来。两者互补:音乐生成做 BGM 和歌曲,TTS 做播客人声。
参考来源
- Suno 官网(定价、商用条款、v4.5 功能):https://suno.com
- ElevenLabs Music 官网(定价、genre 切换功能):https://elevenlabs.ai
- ACE-Step GitHub 仓库(安装命令、Gradio UI、性能基准):https://github.com/ace-step/ACE-Step
- ACE-Step 官网(acemusic.ai):https://acemusic.ai
- 本站《AI 音乐生成工具横评》:https://aiwebcool.com/zh/ai-music-generation-tools-comparison-review