QQ扫一扫联系
一个约 3.6B 的开源模型,把"给段歌词就出一整首歌"这件事从云端搬回了自己的电脑。
YuE2-3B 是 m-a-p 团队 2026 年 9 月开源的整曲音乐生成模型。你给它一段歌词、一句风格描述,它先写出一份能看懂、也能动手改的乐谱,再把这份乐谱渲染成带人声和伴奏的 48kHz 立体声歌曲。想把一首老歌翻新、把中文流行改成英文爵士,走的还是同一套权重、同一套流程。现在它已经打包成 AIGCPanel 的一键运行包,下载导入就能在本机跑。
▶ 大多数 AI 音乐把成品黑盒交给你;YuE2-3B 先把一份可以改的乐谱摊开给你看。
要填的只有两样。歌词 里可以用 [Intro] [Verse] [Chorus] [Bridge] [Outro] 段落标签,模型会按真实歌曲的"前奏—主歌—副歌—尾奏"结构编曲;风格 描述语言、曲风、乐器、人声特点和速度,中英文都认。默认输出就是人声加伴奏的 48kHz 立体声,一次成型。
它也不是"一步出音频"的模型:骨干是 AR–NAR 混合的 Mixture-of-Transformers,先自回归写出乐谱和语义 token,再用 flow matching 生成声学 latent,最后交给 VAE 解码成音频。生成模式分三档——完整规划(旋律 + 和弦)、仅旋律规划、直接生成;想可控就开规划,想快就直接生成。

▶ 它把作曲拆成了两步:先把想法写成符号,再把符号变成声音。两步之间,人随时能插手。
规划出来的乐谱是标准 ABC 记谱,旋律与和弦都是显式文本。下面这段来自项目自带示例:V: Vocal 是人声旋律,V: Ins 是伴奏,带引号的 "C" "G" 是和弦。
X:1
M:4/4
L:1/16
Q:1/4=88
V: Vocal clef=treble name="Vocal Melody" snm="Vocal"
V: Ins clef=treble name="Ins Melody" snm="Inst."
K:C
% verse
V: Vocal
"C"E2G2A2G2E2D2C4|"G"D2E2G2E2D2C2D4|
V: Ins
Z4|
想改就改这份文本,再把改完的乐谱当成新的输入去渲染。官方做过一组编辑实验:在 10 首作品、380 条整曲录音上,改动音符后局部旋律达成度从 0.0083 提到 0.9375,改动时值后和声达成度从 0 提到 0.8313。改的是你指的那一处,不是整首推倒重来。
▶ 乐谱即接口:能读、能改,才谈得上"这段是我说了算"。
翻唱是一条链:原曲音频先进 SheetSage2 转谱,得到旋律 ABC;再配上新歌词和目标风格,交给 YuE2 渲染出翻唱版。在 AIGCPanel 里,这一整条链就是一个「歌曲翻唱」任务,两个环境不用你自己拼。
官方翻唱评测覆盖 948 首作品,每首 2 种目标风格 × 2 个随机种子(每个方法 3792 条输出):给完整乐谱时 YuE2 的 CLEWS mAP 达到 0.647、Hit@1 71.3%,完全不给乐谱只有 0.006。翻唱推荐用「旋律翻唱」模式——保留原曲旋律、伴奏放开跟着新风格改;想让和声也固定,就选「完整谱面」。
WildSongBench 在 2026-09-12 的评测覆盖 192 条提示词、17 个系统,几个关键结果:
| 系统 | SongBench Avg ↑ | AudioBox PQ ↑ | PER ↓ |
|---|---|---|---|
| YuE2(best-of-8) | 6.9632 | 8.2714 | 9.79% |
| Mureka 9 | 6.9377 | 8.0226 | 11.69% |
| Suno v5 | 6.8721 | 8.1698 | 8.10% |
| YuE2 | 6.7316 | 8.2598 | 8.44% |
| Suno v6 | 6.5562 | 8.1296 | 7.58% |
单次生成的 YuE2 拿到 6.7316,已经落在闭源商业模型的区间里;best-of-8 的 6.9632 是这次评测里最高的观察均值。不同指标各有领先者——Suno v6 在 SongEval 和音素错误率上更好,而且这些均值之间的差距属于描述性结果,不构成统计显著性结论。

模型详情:https://aigcpanel.com/zh/asset/YuE2-3B | 软件下载:https://aigcpanel.com/zh/download

如果你手边正好有一段自己写的词,或者一首想换个味道的老歌,可以先在 AIGCPanel 里跑一首短的听听。
▶ 不注册、不排队、不按首付费,你更想让它写首新歌,还是把老歌改成另一种曲风?评论区聊聊。