这篇假设你完全没做过音乐,不懂乐理,也不写代码。你只需要会用浏览器。 这一篇不需要动手,一个软件都不用装,一分钱都不用花。全文约 40 分钟。 第二章讲原理,只想赶紧出歌的人可以先跳过;但第四、五、六章不要跳,那三章决定的不是你做得好不好,而是你做出来的东西能不能发。
这是 AI 音乐系列六篇的第一篇:
- 本篇——AI 写歌到底是怎么回事:动手之前必须先搞懂的原理和三条红线
- Suno 保姆级教程:从注册到你的第一首完整歌曲
- 让 AI 听懂你要的那个味道:音乐提示词进阶
- 把 AI demo 变成能听的成品:分轨、人声、混音母带
- 不只有 Suno:AI 音乐工具全景与本地部署
- AI 音乐怎么合法地发出去:标识、平台政策与上架流程
为什么第一篇要先讲合规
一般的教程都是先教你出成果,最后附一段免责声明。这个系列反过来。
原因很实际:
- 在中国发布 AI 生成的音频,已经是有法可依的强制要求,不是建议。《人工智能生成合成内容标识办法》2025-09-01 已经施行。
- **你用哪个付费档生成的歌,直接决定这首歌能不能商用,而且不能追溯。**先做完再补订阅这条路是走不通的(详见第四章)。
- **有些坑是不可逆的。**克隆一个真人歌手的声音发出去,删掉不等于没发生过。
换句话说,这三条红线不影响你”做得好不好”,它影响的是”能不能发”。等你花了一个月做出一首自己很满意的歌,再回头发现发不出去,那一个月就白花了。
所以:先花 30 分钟把边界搞清楚,再动手。
零、先看能力边界
动手之前,先把期待值校准到 2026 年的真实水平。高估它你会失望,低估它你会错过。
0.1 三年时间它走到了哪
2023 年:能出 30 秒左右的器乐片段,音色是对的,但没有结构——听不出哪里是主歌哪里是副歌。人声基本不能用。那时候它的定位是素材,不是作品。
2025 年:能出两三分钟的完整歌曲,有主歌有副歌,中文人声能听清词,偶尔会唱崩。配短视频已经够用,但细听有一层”塑料感”。这一年开始有人真的拿它去发行。
2026 年(现在):整首结构完整,你可以指定编制和年代。人声接近可用,但仍然要在多个版本里挑。能把歌拆成人声轨和伴奏轨导出,拿进后期软件里精修。唱片公司已经下场谈判——这本身就是它成熟度的证明。
0.2 它现在仍然不会的三件事
这三条是硬边界,2026 年 7 月依然成立:
- **复现你脑子里的旋律。**你哼一段想让它照着写,做不到(部分产品有”哼唱输入”功能,但那是给它一个大致方向,不是精确复现)。
- **按小节改一个音。**你没法说”第二段第三小节那个音高了,降半度”。它没有这个粒度的编辑能力。
- **保证两次生成完全一致。**同样的输入,两次结果不一样,这是设计如此,不是 bug。
0.3 所以正确的用法是”大量生成、你来挑”
这是全系列最重要的一条心智模型,现在就要建立起来。
新手最常见的错误是:生成一次 → 觉得不太对 → 疯狂修改提示词 → 再生成一次 → 还是不对 → 继续改。这条路走不通,因为结果本身就有随机性,你改的那个词可能根本不是变差的原因。
正确的姿势是:写一段还不错的描述 → 一口气生成好几版 → 从里面挑一版最接近的 → 在这一版的基础上继续。
你的角色更接近制作人和 A&R(唱片公司里负责挑歌、挑艺人的岗位),而不是作曲家。你的核心能力是”听得出哪版更好”,不是”改得动某一个音”。
0.4 这一篇里会出现的那首歌
全系列围绕同一首歌推进,歌名叫**《末班地铁》**,一首中文都市民谣。
先说清楚它的边界:**这首歌的歌词是人写的,AI 负责的是编曲和演唱。**这个系列不会教你”一句话全自动出一首好歌”,因为那个东西现在不存在。
这一篇里它只客串一下,用来举例子。它真正诞生是在第二篇。
一、AI 生成音乐和 AI 画画不是一回事
很多人是从 AI 画画那边过来的,会自然地套用画图的经验。这会让你在两个地方摔跤。
1.1 图是空间的,音乐是时间的
一张图,你的眼睛是一次性看完的。角落里有一根手指画歪了,你可能压根不会注意到;就算注意到了,你也可以只重画那个角落。
一首歌,你的耳朵是一秒一秒听完的。它必须从头到尾按顺序发生,而且:
- 你不能跳过中间那一秒
- 中间那一秒唱崩了,你一定会听见
- 而且它会把前后几秒的听感一起拖下水
**图的错误是局部的,音乐的错误是全局的。**这是两者最本质的差别。
1.2 所以”局部重画”这招在音乐里很难使
AI 画图里有一个特别好用的功能叫局部重绘:框住画错的地方,只重新生成那一小块,其余部分原样保留。
音乐里没有真正等价的东西。原因是:一段音频的第 47 秒不是独立存在的,它承接着前面的和弦走向、鼓点位置、人声气口。你把这三秒单独换掉,接缝处几乎一定会露馅。
现在的产品(比如 Suno 的段落替换)提供的是按段落重做——重做整个副歌,而不是重做副歌里的某一句。粒度差着一个数量级。
结论:不要指望”哪里不好改哪里”。要么整段重来,要么换一版。
1.3 第二个差别:它的输出没有”图层”
画图工具至少还能导出分层文件。音乐生成出来的是已经混好的一整段音频——人声、吉他、鼓、贝斯全糊在一起。
后来出现的”分轨”功能(把一首歌拆成人声轨、伴奏轨等)是事后拆,不是生成时就分开的。事后拆一定有损失,拆出来的人声可能带一点混响尾巴或者”水声”。第四篇会详细讲这件事。
所以你拿到的是一个已经定型的成品,不是一堆可以自由重组的零件。这决定了你对它的控制方式只能是”生成前描述清楚”,而不是”生成后慢慢调”。
1.4 唯一的好消息
音乐比画图更容易”及格”。
一张画得平庸的图,一眼就看出来平庸。一首编曲平庸但音色干净、结构完整的歌,配上你自己写的词,在大多数使用场景里(短视频背景、个人作品、送人的生日歌)是完全够用的。
音乐的下限比图像高。这也是为什么现在拿 AI 音乐做实用产出的人比想象中多。
二、一首 AI 歌是怎么被造出来的
这一节是原理,不影响你操作。只想赶紧出歌的话,可以直接跳到第三章,等你开始好奇”为什么它不听我的”的时候再回来。
2.1 把它想成一次翻译,而不是一次作曲
最有用的类比是:它不是在作曲,它是在做翻译。
你给它一句中文描述,它要把这句话翻译成一段音频。中间大致有四步:
第一步:你写的那句话。比如「深夜 都市民谣 男声 木吉他」。这是整条链路里唯一你能控制的地方。
**第二步:模型把它翻译成一组可执行的条件。**这里的”条件”你可以理解成一份约束清单:速度大概多少、用什么乐器、人声是什么质地、情绪往哪个方向走。你的每一个词都会变成清单上的一条或几条;你没写的部分,清单上就是空的。
**第三步:按条件一段一段生成音频的碎片。**它不是一次性吐出整首歌,而是像写文章一样,一小块一小块往下接,每一块都要参考前面已经生成的内容,同时对照那份条件清单。
**第四步:声码器把碎片还原成真实波形。**声码器这个词的意思是”把压缩过的声音表示还原成你耳朵能听的声音”——有点像把一份压缩包解压成音频文件。这一步决定了最终听感的清晰度和”塑料感”程度。
第二到第四步全部发生在云端,你看不见也改不了。
(你可能在别处看到过 transformer、diffusion 这类词,它们描述的是第二到第四步的实现方式。知道它们对你写提示词没有任何帮助,这篇不展开。)
2.2 关键推论一:描述得越具体,它还原得越准
这是本章最重要的一句话,也是整个系列的地基。
回到”翻译”这个类比。假设你请一个翻译把一句话翻成外语:
- 你说「翻得好听一点」——他不知道你要什么,只能凭自己的口味发挥
- 你说「翻成 1930 年代的书面语,句子短,别用外来词」——他能翻得很接近你要的
生成音乐是同一件事。你的描述会变成条件清单上的条目,清单上没写的部分,模型就自己填。它自己填的时候用的是”最常见的那种做法”,加上一点随机。
所以:
- 描述具体 → 条件多 → 它的发挥空间小 → 结果稳定、接近你要的
- 描述抽象 → 条件少 → 它的发挥空间大 → 结果基本靠运气
举个对照。同样是想要一首深夜感的中文民谣:
写得抽象:一首好听的中文民谣
写得具体:中文都市民谣, 男声, 木吉他分解和弦, 电钢, 轻柔鼓刷,
慢速, 深夜感, 温暖干净的制作, 微微沙哑的气声
第二段就是《末班地铁》实际用的描述。它比第一段多给了七类信息:地域、流派、编制、速度、情绪、人声特征、制作质感。每多一类,模型的自由发挥就少一块。
这就是为什么提示词值得单独写一整篇(第三篇)。它不是玄学,它是在补条件清单上的空格。
2.3 关键推论二:一秒钟的错误会毁掉整首
第三步是”一小块一小块往下接”,每一块都要参考前面的内容。这带来一个必然的后果:
某一块生成得不好,后面的块会基于这个不好的结果继续往下接。
于是你会遇到这些现象:
- 唱到一半突然咬字含糊,然后一路含糊到底
- 副歌开始时和声突然歪了
- 结尾没有收,直接断掉
- 中间莫名其妙插进来一段不该有的乐器
这些不是你写错了提示词,是概率。同一段描述再生成一次,很可能就正常了。
这条推论直接决定了操作方式:**遇到唱崩,第一反应应该是重新生成,而不是改提示词。**改提示词是用来调整方向的,不是用来修 bug 的。
新手最容易浪费点数的地方就在这里——把一次随机失误当成描述错误,然后越改越乱。
2.4 顺带解释一个常见困惑
“为什么我和别人写了差不多的描述,出来的歌听着很像?”
因为条件清单相似,模型填空的方式也就相似。Suno 的服务条款里明确写着:输出在用户之间可能不唯一,别人可能拿到相同或相似的结果(suno.com/terms,最后修订 2026-03-26)。
这不是巧合,是这类工具的固有属性。第四章讲版权的时候,这一点还会再出现一次。
三、为什么提示词这么写才有效
上一章讲了”描述会变成条件”。这一章讲哪些描述能变成条件,哪些变不成。
3.1 一条规律就能概括
能翻译成声音特征的词,有效;表达主观评价和指名道姓的词,无效。
后半句还有一层:指名道姓不仅无效,还会踩红线(第六章讲)。
3.2 它听得懂的五类词
- 流派:民谣、citypop、硬摇滚、trap、bossa nova。流派是最强的一类词,因为一个流派名字里打包了速度、编制、节奏型、混音风格一大堆信息。
- 乐器:木吉他、电钢、弦乐、合成器 pad、鼓刷。写乐器等于直接指定编制。
- 年代与地域:90 年代日本、80 年代英伦、当代中文。年代决定的是制作方式和音色审美,地域决定的是旋律走向和语言。
- 情绪与场景:深夜、通勤路上、雨天、庆典。情绪词会影响和弦色彩和速度。
- 人声特征:男声、女声、气声、慵懒、沙哑、高亢。
这五类词的共同点是:它们都能对应到实际的声音差异上。模型在训练时见过大量”这个描述配这种声音”的样本,所以它知道该怎么填。
3.3 它听不懂的四类词
- 主观评价:好听、高级、有质感、专业、大气。这些词对应不到任何具体的声音,模型只能当噪音处理。
- 指名道姓:像周杰伦、像 Taylor Swift、某某歌手的风格。这类词多数产品会直接过滤或忽略,而且——这是红线,第六章会讲清楚为什么不能这么用。
- 精确的位置指令:第二段第三小节改一下、把 1 分 20 秒那个音去掉。它没有这个粒度。
- 跨次一致性要求:和上一版保持一致、只改这一处别动其他的。每次生成都是独立的,它没有”上一版”的概念。
3.4 一个常见的自我检验方法
写完描述之后,逐个词问自己一句:“这个词能对应到一种具体的声音吗?”
- “沙哑” → 能,那是一种嗓音质地 → 留着
- “温暖干净的制作” → 能,那是一种混音取向 → 留着
- “高级” → 不能,什么声音算高级? → 删掉
- “副歌要更炸一点” → 不能,“炸”是听感结果不是声音特征 → 改写成”副歌加入满编鼓组和电吉他”
这个检验做熟了,你的提示词水平就已经超过大多数人了。
3.5 这一节和第三篇的关系
这一章只讲了”哪些词有效”这个原则。真正的实操——怎么组合这些词、每个流派该配哪些词、结构标签怎么用、失败了怎么定位是哪个词的问题——在第三篇《提示词进阶》里。
这里你只需要记住那条规律:能翻译成声音特征的词才是词,其余都是噪音。
四、红线一:能商用 ≠ 有版权(截至 2026-07-23)
从这一章开始是三条红线。这三章的信息保质期只有一个季度左右,日后请以各家官网当前条款为准。
4.1 这是全篇最反直觉的一条
多数人的默认理解是:“我付了钱、用工具做的东西,那就是我的。”
在 AI 音乐这里,这个理解是错的。正确的表述是:
你拿到的是”商用授权”,不是”著作权”。
这两件事的差别是:
- 商用授权 = 你可以拿它去卖钱、去发行、去接商单、去做广告配乐。
- 著作权 = 别人未经许可用了你的东西,你可以告他。
AI 生成的音乐给你的是第一个,很可能给不了你第二个。
4.2 这不是我的解读,是工具方自己写的
Suno 的帮助中心页面(help.suno.com,查证于 2026-07-23)自己写得很清楚:
- 免费档(Basic):Suno 是歌曲的所有者,用户只能非商业使用。
- 付费档(Pro / Premier):你拥有歌曲,并获得商用授权。
- 同一个页面上同时提醒:美国版权法只保护人类创作的内容,100% 由 AI 生成的音乐很可能不具备版权登记资格。
- 补充一句关键的:如果歌词是你写的,歌词部分归你。
最后那条很重要,第 4.5 节展开讲。
4.3 违反了会怎样
分三种情况:
**情况一:用免费档生成的歌拿去商用。**这是直接违反用户条款。后果不是”可能有点风险”,而是你从一开始就没有那份授权——发行商核查时可能拒绝上架或事后下架,平台可能撤下作品,如果是接的商单,客户追责时你拿不出任何授权凭证。
**情况二:以为自己有版权,去维权。**你发现别人在用一首和你几乎一样的曲子。你想告他,但你可能:(a)拿不到版权登记;(b)对方的曲子是他自己独立生成的,而工具方明说了输出可能不唯一。这种情况下你大概率告不赢。
**情况三:以为可以事后补授权。**详见下一节。
4.4 一个特别容易踩的坑:授权不能追溯
二手来源(Digital Music News 2025-12-22 对 Warner 协议后条款变化的报道)提到的一条规则是:订阅之后回头给之前生成的歌补商用授权 —— 不行。
翻译成人话:你必须在生成那一刻就已经是付费用户,这首歌才带商用授权。免费玩了三个月,觉得第 47 首特别好,这时候再去订阅——那首歌拿不到授权。
同一批报道还提到,Warner 协议之后 Suno 帮助页的标题从「Do I have the copyrights」改成了「Do I own the copyrights」,措辞从”你拥有歌曲”弱化成”你被授予商用使用权”。但本次调研抓到的帮助页仍然是旧措辞——说明这块正在反复改动。
所以这条的实操建议是:**如果你有任何商用打算,从第一次生成开始就用付费档。**不要先免费试,试爽了再订阅。
4.5 还有一个坑:Remix 是共同作品
Suno 服务条款(suno.com/terms,最后修订 2026-03-26)里另有一条,很多人没注意:
Remix 属于你和 Remixer 的共同作品。无论你是免费还是付费用户,Remix 只能用于合法的、内部的、个人的、非商业用途,并且必须署名 Suno。
也就是说:你拿别人公开的作品做 Remix,做得再好,都不能商用。这一点在第三篇讲局部返工的时候会再强调一次。
4.6 那怎么让作品尽量”是你的”
回到 4.2 最后那句:歌词由你写,歌词部分归你。
这给出了一条明确的提升路径。你在这首歌里的人类创作成分越多,你能主张的权利就越多:
- 歌词自己写——这是最容易做到、贡献也最大的一步
- 结构自己定——哪里是主歌哪里是副歌,段落顺序,由你安排
- 后期自己做——分轨、混音、母带都是人类创作性劳动(第四篇)
- 人声自己录或用自己的声音(第六章讲合规路径)
《末班地铁》就是这条路线:**歌词是人写的,AI 负责编曲和演唱。**这不是为了炫技,是为了让这首歌尽量站得住。
注意:不同国家的版权认定规则不同,中国的具体认定标准本文未做查证。上面这条”增加人类创作成分”的思路是通用的降低风险做法,不构成法律意见。涉及金额较大的商用,请咨询专业人士。
五、红线二:中国的标识办法已经生效(2025-09-01 施行)
上一条红线管的是”你有什么权利”。这一条管的是”你能不能发”。
5.1 这是法规,不是平台规则
《人工智能生成合成内容标识办法》(国信办通字〔2025〕2 号),由国家网信办、工信部、公安部、广电总局四部门联合制定,2025-03-14 发布,2025-09-01 施行。原文在网信办官网可以直接查到。
请注意它和平台社区守则的区别:平台规则是平台定的,法规是国家定的。管辖范围包括文本、图片、音频、视频、虚拟场景——音频明确在内。
5.2 两个必须先分清的概念
办法把标识分成两类(第三条):
- 显式标识:用户能明显感知到的提示。对音频来说,就是一段语音提示或者一段特定的节奏提示音。
- 隐式标识:藏在文件数据里的技术性标记,人听不见,机器读得到。
这两个都要有,不是二选一。
5.3 落到音乐上,是三件事
第一件:音频里要有提示。
第四条第(二)项要求:音频应在起始、末尾或者中间适当位置添加语音提示或者音频节奏提示等标识,或者在交互场景界面中添加显著的提示标识。
第二件:导出的文件要带标识。
第四条末款:服务提供者提供下载、复制、导出功能时,必须确保文件中含有符合要求的显式标识。
第五条:还要在文件元数据里添加隐式标识,包含内容属性、服务提供者名称或编码、内容编号。办法同时鼓励加数字水印。
第三件:发布时要主动声明。
第十条:用户发布时应当主动声明并使用平台提供的标识功能。
对应的,第六条规定了传播平台(抖音、B 站、网易云这类)的义务:核验元数据里的隐式标识,核验到就加显著提示;用户自行声明的也加提示;没声明但检测到生成痕迹的,标为「疑似生成合成内容」。
5.4 违反了会怎样
办法第十条写得很直接:
任何组织和个人不得恶意删除、篡改、伪造、隐匿标识,也不得为他人提供此类工具或服务。
注意最后半句——提供去标识的工具本身也是违规的。所以不要去搜”怎么去掉 AI 标识”,那条路本身就在禁止范围内。
另有第九条:用户可以申请获取不含显式标识的内容(比如你要拿去做后期),但服务提供者必须在用户协议里明确你的标识义务和使用责任,并留存提供对象信息等日志不少于 6 个月。
翻译成人话:你拿到无标识版本这件事,是有记录的,且责任转移到了你身上。
至于平台侧的实际处罚力度——限流、下架、封号——这类说法来自二手的合规解读文章,各平台官方规则原文本次未逐一核实。写这篇时能确认的是:主流平台的上传流程里都已经有 AI 内容标签这个选项。具体后果请以你要发布的那个平台的创作者规则页为准。
5.5 为什么这一条要放在第一篇
因为它决定的不是”做得好不好”,而是”能不能发”。
等你做完一首歌、交完订阅费,再回头发现发不出去,成本就白付了。
完整的加标识操作步骤在第六篇。这里你只需要记住一句:发布不是导出就完事。
六、红线三:别克隆真人歌手的声音(截至 2026-07-23)
这条红线是三条里后果最重的一条。前两条踩了通常是”发不出去”,这条踩了可能是”被起诉”。
6.1 明确的禁止
Spotify 在 2025-09-25 发布的 AI 音乐政策中,直接写道:未经授权使用 AI 克隆艺人声音,是对其身份的剥削,破坏其艺术性,威胁作品的根本完整性。
同一份政策里也说明:部分艺人可以选择授权自己的声音给 AI 项目,但选择权必须留在艺人手里。
这条冒名(impersonation)政策当日立即生效,没有过渡期。(来源:Music Business Worldwide 对该政策的报道,2025-09-25。)
6.2 国内同样有法律风险
中国法下,自然人的声音受人格权保护——《民法典》人格权编规定声音参照适用肖像权保护的相关规定。
说明:具体条文编号本次未核对原文,这里标注为未查证。如果你要在正式场合引用条号,请自行到法律法规数据库核实后再用。这条原则本身是清楚的:未经许可使用他人的声音,可能构成侵权。
6.3 “AI 翻唱”是最危险的玩法
拿别人的歌 + 明星音色做 AI 翻唱,是网上传播最广、也最危险的一种玩法。它同时踩三条线:
- 录音版权——原始录音是有版权的
- 词曲著作权——词和曲各自有著作权
- 声音 / 人格权——被克隆的那个人的权利
关键在于:**标注「AI 生成」不能免除以上任何一项责任。**标识办法解决的是”信息透明”问题,不解决”你有没有权利用这些素材”的问题。这两件事是独立的。
(这条判断来自国内合规解读文章,属二手来源;但三项权利各自独立成立,是著作权法与人格权保护的基本结构。)
6.4 开源工具不提供任何保护
有人会想:用开源的音色转换工具在本地跑,没人知道。
这个想法有两个问题:
- **本地跑不改变行为的性质。**侵权与否看的是你做了什么、发了什么,不是在哪台机器上做的。
- **开源工具”免费”,但也不提供任何法律保护。**商业工具至少还有条款、有客服、有些企业档甚至提供法律赔偿保障;开源仓库的 LICENSE 通常会明确写”作者不承担任何责任”。出事全部由使用者承担。
6.5 那想要人声怎么办:两条合规路径
好消息是,合规路径是存在的,而且够用:
路径一:用工具自带的授权音色。
生成工具内置的歌手音色,是工具方已经处理好授权的。你在它给的音色库里挑,法律层面是干净的。
路径二:克隆你自己的声音。
这是最稳妥的一条。你自己的声音,你自己有完整的权利。
举例:Suno 在 2026-03-26 随 v5.5 上线了 Voices 功能——录制或上传自己的声音后,让它用你的嗓音演唱。同期还有 Custom Models(上传自己作品集里至少 6 首曲子,训练一个属于你的模型变体)。
第四篇只会讲这两条路径,不会给任何绕过手段。
6.6 一句话总结这一章
你可以让 AI 用”某种嗓音”唱歌,不能让 AI 用”某个人”的嗓音唱歌。
描述音色特征(男声、沙哑、气声、高亢)是完全没问题的;指名道姓是有问题的。这也解释了第三章里为什么”像某某歌手”既无效又危险——它同时踩了两个坑。
七、这个领域正在被唱片公司改造(截至 2026-07-23)
这一章不是八卦,是给你一个心理预期:你今天学到的规则,半年后可能就变了。
这一整节的信息保质期最短。下面每一条都标了来源类型,凡标注”二手”的,请自行到一手页面复核。
7.1 Suno:仍然最好用,但规则正在被改写
- 当前主力模型 v5.5,发布于 2026-03-26(官方发布页与更新日志)。
- 付费档可用 v4、v4.5、v4.5+、v5、v5.5;免费档只能用 v4.5-all(官方定价页)。
- 华纳音乐集团(WMG)于 2025-11-25 与 Suno 达成和解并签署协议(二手:Music Business Worldwide)。
协议预告的变更(全部为二手来源,且截至 2026-07-23 尚未在官方定价页体现):
- 免费档歌曲将不可下载,只能播放和分享
- 下载需付费账号,且付费档会有每月下载次数上限,超出需另购
- 新的”授权模型”上线后,现有模型将被弃用
- 订阅之后回头给之前生成的歌补商用授权 —— 不行
**注意最后一条已经在第四章讲过,那是目前唯一已经在生效的一条。**其余三条属于预告,随时可能落地。
第二篇的档位介绍会单独成节,就是为了这一天到来时可以整节替换。
7.2 Udio:已被收编,至今不能下载
Udio 原本是 Suno 之外最主要的选择,现在处于”关门装修”状态。
- 2025-10-29/30,环球音乐(UMG)与 Udio 和解,同时宣布共建授权平台,新平台计划 2026 年上线(一手报道:Music Business Worldwide,2025-10-30)。2025-11 中旬 WMG 也与 Udio 达成合作(二手)。
- **和解当天 Udio 关闭了全部音频、视频、分轨的下载。**因用户强烈反弹,仅在 2025-11-03 至 11-05 开放了 48 小时下载窗口(二手:RouteNote)。
- 截至 2026-07-23,下载仍未恢复,授权版新平台仍未公开上线。
- 2026-07-17 Udio 宣布与 BuyDRM 合作做内容保护,进一步收紧(来源:Digital Music News,2026-07-17)。
结论:现阶段不建议把 Udio 作为主力工具——你的作品拿不出来。
它的定价档位本次未查到官方数字,二手来源的说法不予采信,本系列不写。
7.3 Riffusion:已被 Google 收购
- 抓取 riffusion.com 与 producer.ai(2026-07-23),两个域名返回的是同一个页面,页面标题为「Google Flow Music」。
- 二手:Google 于 2026-02-24 收购 ProducerAI(由 Riffusion 更名而来),团队并入 Google Labs / DeepMind,产品改由 Lyria 3 驱动(musically.com,2026-02-25)。
- 它的商用条款本次未查证(未抓到 Terms 页),所以本系列不对它的授权规则做任何判断。
7.4 Sony:唯一还没和解的大厂
在 RIAA 牵头的大厂诉讼中,UMG(2025-10 与 Udio 和解)、WMG(2025-11 与 Suno、Udio 和解)已经退出。索尼是唯一尚未和解的大厂(二手:Music Business Worldwide)。
这件事为什么和你有关:**这场诉讼的结果会影响所有人可以用什么、怎么用。**如果和解,格局大概率继续沿着”授权化”走;如果打到判决,结论会成为整个行业的基准线。
另外一条值得注意:美国音乐家工会 AFM 已起诉 UMG 与 WMG,指其与 Suno / Udio 的和解损害了乐手利益(Hollywood Reporter 报道)。也就是说,就算大厂之间谈妥了,创作者一侧的争议还在继续。
7.5 给你的心理预期
**半年后这一章大概率不一样。**具体来说,最可能变的是这几件事:
- Suno 的下载规则和模型列表(协议已预告,随时落地)
- Udio 是否恢复下载、授权版平台是否上线
- 各平台的 AI 披露机制(Spotify 的 AI Credits 仍在 beta,Apple 的透明度标签才上线几个月)
- 所有工具的价格与额度
所以本系列的做法是:**把价格和政策单独成节,节标题带日期,方便日后整节替换。**你在读的时候也请注意这些日期——超过三个月的,请自行复核。
至于原理(第二、三章)和法规原文(第五章),这两块相对稳定,一年内不太会变。
八、你适合做哪一档
三条红线讲完了。最后帮你决定后面读什么。
按目的分三档,读的内容完全不同:
8.1 玩票档:做给自己和朋友听
特征:做生日歌、给自己的诗配曲、纯粹好奇、不发到公开平台。
你需要读:第二篇(做出第一首歌)就够了,第三篇看心情。
红线关注度:三条红线里,你只需要在意第六章那条——不要克隆真人歌手,哪怕只是发给朋友。前两条对你影响不大,因为你不商用、不公开发布。
成本:可以完全免费。
8.2 配乐档:给自己的视频、播客、店铺用
特征:短视频背景音乐、播客片头、直播垫乐、自己产品的宣传片。
你需要读:第二篇 + 第三篇 + 第五篇(第五篇里有专门讲授权更干净的纯 BGM 工具)。第四篇可以选读。
红线关注度:
- **第四章(能商用≠有版权)要读。**只要视频挂了广告、店铺在卖东西,你就算商用。从第一次生成就要用付费档。
- **第五章(标识办法)要读。**发到国内平台就要标。
- 第六章基本用不上,因为你多半做纯器乐。
成本:需要付费订阅,或者选一家授权路线更干净的 BGM 工具。
8.3 发行档:真的要把歌发到音乐平台上
特征:想上架网易云、QQ 音乐、Spotify,想有正式的作品,可能想赚点钱。
你需要读:六篇全读,一篇都不能跳。尤其是第四篇(后期)和第六篇(发行合规)。
红线关注度:三条全部适用,而且要求最严。补充两条:
- 歌词一定自己写(第 4.6 节讲的理由)
- 后期一定自己做,这既提升质量,也增加你的人类创作成分
成本:订阅费 + 可能的发行商年费 + 后期工具。第六篇会给一个诚实的收益预期——不画饼。
8.4 如果你还不确定
那就按这个顺序:读第二篇,做一首歌出来,听完再决定。
大部分人做完第一首之后,对自己想去哪一档会突然变得很清楚。
九、翻车速查
这一篇没有操作,所以这里列的是认知层面的翻车——它们全部是真实会造成损失的误解。
| 你以为 | 实际上 | 后果 |
|---|---|---|
| 付了钱做出来的歌就是我的作品,有完整版权 | 你拿到的是商用授权,不是著作权;100% AI 生成的音乐很可能不具备版权登记资格 | 别人用了同款曲子,你告不赢 |
| 先用免费档玩,做出好歌再订阅补授权 | 授权不能追溯,必须在生成那一刻就是付费用户 | 你最满意的那首歌拿不到商用授权 |
| 免费档做的歌,自己视频里用一下没关系 | 视频挂广告 / 店铺带货就算商用,免费档明确禁止商用 | 违反条款,发行或商单环节拿不出授权 |
| Remix 别人的作品做得好就能发 | Remix 属共同作品,无论付费与否都只能非商用,且须署名 Suno | 商用即违约 |
| 标注了”AI 生成”就免责了 | 标识办法解决透明度,不解决素材权利;翻唱仍踩录音版权 + 词曲著作权 + 人格权 | 三项责任一项都跑不掉 |
| 加标识是平台的事,我导出就完事了 | 用户发布时应当主动声明;恶意删改标识是明令禁止的 | 平台限流下架,且属违规行为 |
| 在本地用开源工具克隆声音,没人知道 | 侵权看行为不看运行环境;开源不提供任何法律保护 | 出事全部自己承担 |
| 写”像某某歌手”能让它更接近我要的风格 | 这类词多数会被忽略或过滤,同时踩人格权红线 | 白写,而且危险 |
| 生成的歌唱崩了,说明我提示词写错了 | 那是概率,不是描述错误 | 越改越乱,白烧点数 |
| 哪里不好改哪里,像 AI 画图那样局部重绘 | 音乐是时间序列,最小编辑粒度是段落不是句子 | 接缝一定露馅 |
| 同样的描述再来一次能得到一样的结果 | 结果本身有随机性,输出在用户之间可能不唯一 | 期待错位 |
| 国外平台的规则和国内一样 | 中国有强制性法规,海外是平台政策,两套体系 | 漏做国内的标识 |
一句话概括这张表:几乎所有翻车,都来自把 AI 音乐当成”我的作品加速器”,而不是”一个有明确边界的授权工具”。
十、下一步
10.1 这一篇你应该带走的五句话
- 它不是在作曲,是在按你的描述还原一段音频——所以描述越具体,还原越准。
- 唱崩是概率,不是你的错——第一反应是重新生成,不是改提示词。
- 能商用 ≠ 有版权——而且授权不能追溯,有商用打算就从第一次生成开始付费。
- 在中国发布 AI 音频要加标识——这是法规,2025-09-01 已经施行。
- 不要克隆真人歌手——想要人声,用授权音色或者你自己的声音。
10.2 接下来读哪一篇
第二篇会带你从注册开始,一步步做出一首两三分钟、有主歌有副歌、能下载的完整歌曲——就是这一篇里提到的那首《末班地铁》。里面会给出完整的风格描述和歌词全文,你可以原样复制,当场复现。
第二篇还会讲清楚这几件事:
- 三个订阅档位的真实差别,以及三个必须先知道的坑
- Simple 模式和 Custom 模式分别适合谁
- Style / Lyrics / Title 三个框各管什么——这是绝大多数人用不好 Suno 的根本原因
- 点数怎么花不浪费
如果你暂时不打算用 Suno(比如网络不方便,或者只想要纯器乐 BGM),可以直接跳到 第五篇:工具全景与本地部署,那里有一张按用途选工具的决策树,也讲了国内可以直接访问的产品和开源本地方案。
10.3 这一篇的保质期
- 第二、三章(原理与提示词规律):一年以上有效。
- 第五章(标识办法条文):部门规章,短期内不会改;但配套国标和平台执行细则会变。
- 第四、六、七章(授权条款、平台政策、行业格局):**保质期约一个季度。**建议你每次要正式发布作品之前,回到各家官网现场核对一次。
本篇所有事实的抓取日期均为 2026-07-23。凡文中标注”二手”或”未查证”的内容,请勿直接当作依据使用。
留言功能暂时不可用,请稍后再试。