☰
YuE2 技术报告:SongBench 6.96 碾压公开基线,Suno v5 该慌吗?
2026/10/10 23:58:06 网站建设 项目流程

YuE2 技术报告:SongBench 6.96 碾压公开基线,Suno v5 该慌吗?

【免费下载链接】Yue2项目地址: https://ai.gitcode.com/hf_mirrors/Comfy-Org/Yue2

就在中文社区的技术报告解读集中出现的前一天(报告正文已于 9 月 27 日挂上 arXiv,10 月 8 日社区解读开始发酵),香港科技大学与 M-A-P 团队放出了 YuE2 的 56 页完整技术报告。最抓眼球的一句话是:在 WildSongBench 上,YuE2 的 SongBench 全局平均分达到 6.96(best-of-8),是全部受测系统中最高的观测均值;专家听感评测则显示其"音频质量与商用系统 Suno v5 相当"。一时间"开源碾压 Suno"的叙事铺满评论区。

但把报告读透之后会发现,6.96 这个数字的成立有一整套前提:评测集是 192 条真实用户提示的 WildSongBench,6.96 是"8 个候选中择优"的采样口径,而"碾压"的对象严格来说是 8 个公开基线——在面对 Suno v5 时,专家偏好其实打成了 40.4% 对 39.9% 的平手。本文从报告原文出发,拆解 6.96 分的来路、专家评测的设计细节,以及分数口径之外那些容易被标题忽略的局限。

一、6.96 分怎么来的:一条从乐谱到 48kHz 立体声的生成链路

先理解 YuE2 的技术骨架,因为 SongBench 分数背后是一个与主流"端到端音频生成"截然不同的架构。

YuE2 用一个约 3.58B 参数的 AR–NAR Mixture-of-Transformers(MoT,28 层、隐宽 2048、上下文 24,576 位置)把生成过程显式分解为三层:

  1. 符号作曲规划(s):先用 ABC 文本乐谱写出旋律、和弦、调性、拍号、速度与曲式结构——这是人可读、可改的中间产物;
  2. 语义音乐 token(c):把乐谱展开为 25Hz、375 bit/s 的 MERT2 语义 token 序列(32,768 项码本,每 40ms 一个 token);
  3. 连续声学隐变量(z):在乐谱与语义 token 条件下,通过双向 flow matching 预测 25Hz×64 维的声学 latent,最终由独立训练的 Oobleck VAE 解码为 48kHz 立体声波形。

生成概率被因式分解为p(score, semantic | text) × p(acoustic | text, score, semantic):自回归流负责"先作曲再填细节",非自回归流负责"按谱演奏"。训练数据约 34.6 万小时音乐,全程 bf16、64 张 H800。

这套设计的直接后果是:同一个 checkpoint 能同时做创作、按谱编辑与零样本翻唱,因为三者只差"乐谱从哪来"——创作是模型自己写谱,编辑是用户改谱后重渲染,翻唱则先用 SheetSage2 把参考录音转成乐谱再换风格渲染。本仓库作为 ComfyUI 生态的重打包版,恰好把这条链路的三个关键权重都带了进来:

ComfyUI/ └── models/ ├── audio_encoders/ │ └── sheetsage2_bf16.safetensors └── checkpoints/ ├── yue2_3b_bf16.safetensors └── yue2_3b_int8_convrot.safetensors

其中audio_encoders/sheetsage2_bf16.safetensors正是全曲主旋律转录器 SheetSage2(报告称其在 15 组全曲转录对比指标中领跑 12 组,RWC-Pop 人声旋律 F1 从 62.71 提升到 82.51),checkpoints/yue2_3b_int8_convrot.safetensors则是为消费级显卡准备的 int8 量化变体——社区实测 24GB 显存即可本地跑通,这也是"本地 71 秒生成一首 3.6 分钟歌曲"类教程能成立的基础。

二、6.96 的完整口径:192 条提示、两候选与 best-of-8

回到分数本身。SongBench 是报告引入的七维歌曲质量评测(Musicality、Melody、Arrangement、Structure、Instrumental、Mixing、Vocal),全局平均分(Global Avg)取七维均值。所有系统统一跑在 WildSongBench 上:192 条"在野"真实用户请求,覆盖 15 个流派桶,其中 94 条中文、98 条英文提示,歌词与风格描述经各系统原生接口喂入。

比较协议的关键是候选预算:标准对比中,每个系统对每条提示生成 2 个候选,取 ASR 四次转写中音素错误率(PER)较低的那个。在此口径下:

  • YuE2:SongBench 全局平均 6.7316,Musicality 5.9075;
  • 8 个公开基线全部低于它:YuE1 4.9165、SongBloom 4.2350、LeVo 2 6.3247、ACE-Step 1.5 6.0118、HeartMuLa 6.2483、DiffRhythm 2 5.2428、Muse 6.0349、MiniMax Music 3 6.2830。

所以"全面碾压公开基线"这个表述在 6.7316 口径下就是成立的,而且是用 3.58B 参数打出的——报告中 8 个公开基线里 6 个参数比它多,例如 HeartMuLa 为 5.43B。

而标题里的6.96 是 best-of-8 口径:对每条提示生成 8 个候选,先剔除在 SongBench Musicality、Q3O、PER 三维上被支配的候选,再保留 Musicality 最高值 0.10 以内的,然后依次按 Q3O 与 PER 择优。在此口径下 YuE2 达到6.9632(SongBench Global Avg)与 6.2666(Musicality),是包括商用系统在内所有受测系统中最高的观测均值——Suno v5 为 6.8721,Mureka 9 为 6.9377。

值得指出的是,best-of-8 同时也带来了采样成本上的不对等:商用接口通常每次请求只返回 2 首歌,而 best-of-8 意味着 8 倍生成预算外加一次按指标排序的选择。换句话说,6.96 是"8 选 1 + 择优"后的上限观测值,6.7316 才是与商用接口同预算口径下的默认表现。在同一张表里,两候选口径下 Mureka 9(6.9377)与 Suno v5(6.8721)仍排在 YuE2 之前,这一点与"碾压一切"的传播口径存在温差。

三、专家评测与 Suno v5"对齐"的细节与前提

自动指标之外,报告把专家听感评测当作感知质量的首要证据,其流程设计相当严谨:线上经 X、GitHub、Hugging Face 招募了 289 场参与(837 组保留评价),另有 62 名具有音乐学院训练背景或音频 AI 研究经验的付费标注者(来自中央、上海、星海等音乐学院),合计 4,439 组保留成对评价;系统身份隐藏、A/B 顺序随机、每首歌至少聆听 30 秒,且每批 32 题埋入 5 个一致性检查(同音频必须判平、反转顺序必须保持原偏好)。

在这个协议下,针对六个商用基线(Suno v4.5 / v5 / v5.5 / v6 / v6 Wild、Mureka 9):

  • YuE2(best-of-8)vs Suno v4.5:57.3% 对 30.5%,明显胜出;
  • vs Suno v5:40.4% 对 39.9%——几乎打平,这正是"对齐 Suno v5"表述的来源;
  • vs Suno v6:31.6% 对 59.3%——反而落后,尽管自动指标上 Bo8 的 SongBench Avg 更高;
  • 音频质量是突出强项:对六个商用基线的平局调整后平均偏好达到58.9%(CR1 95% 置信区间 55.6%–62.2%,p = 1.70×10⁻⁶),即在纯声音保真度与混音上,专家对 YuE2 的偏好全面占优。

换言之,"Suno v5 慌了"这种情绪化标题需要降级为更准确的技术表述:在一个需要逐题聆听、30 秒起评、一致性校验的盲听协议下,一个 3.58B 的开源模型在整体质量上与 Suno v5 打成平手,在音频质量维度上系统性占优——这是开源音乐生成第一次在"成品感"上站到商用第一梯队,但距离"碾压"还有 v6 这道坎。

报告还顺手回答了"符号规划到底有没有用":用同一 checkpoint、同一提示、同一采样预算做消融,专家在整体质量上偏好"先写旋律+和弦乐谱再渲染"的比例为49.3%,远高于无规划生成的 34.6%(p=0.0070),音乐性维度为 45.0% 对 29.4%;而把语义 token 预测与声学生成合并进统一 MoT、而非分离的 LM+DiT,整体质量偏好为 53.4% 对 35.6%(p=0.0084)。乐谱不只是"可解释"的附加品,它本身就在提升听感。

四、报告之外:分数口径与评测集的三点冷静

读技术报告不能只读摘要。以下三点是理解 6.96 乃至整个评测体系必须带上的上下文。

第一,分数口径会说话。"6.96 最高观测均值"与"6.7316 两候选口径"是同一个模型的两个数字,传播时前者被反复引用、后者被略过。此外报告在二维指数可视化中给出了更细腻的定位:质量指数(SongBench: SongEval 按 2:1 加权)上 YuE2 Bo8 为 88.34,但Mureka 9 的质量指数最高(90);对齐指数上Suno v5 最高(90),YuE2 Bo8 为 83.89。在 0.6–0.8 的权重区间内做敏感性分析时,Musicality 合成指数最高的是 YuE2 Bo8,而全局平均合成指数最高的是 Mureka 9——不同维度上谁是第一,取决于你更看重哪个指标。

第二,评测集与基线存在不对称。WildSongBench 是 192 条提示的小样本评测,流派覆盖 15 桶,中英比例为 94:98;所有公开基线中,HeartMuLa 被报告以 † 标注——它明确在训练后处理中使用了 SongEval 与 AudioBox 来过滤 SFT 数据并构造 DPO 偏好对,属于"用评测指标训练模型"的情况。报告如实披露了这一点并把分数保留在排名里,但读者横向比较时仍应意识到:各家基线对评测指标的暴露程度并不相同。同理,SongEval 维度上 HeartMuLa(4.5519)高于 YuE2 Bo8(4.2960),歌词准确率(PER)最低的是 MiniMax Music 3(0.0627)而非 YuE2(0.0844)——"碾压"在个别维度并不成立。

第三,工程落地与许可边界同样重要。本仓库重打包自 m-a-p 的 YuE2-3B 与 SheetSage2,README 明确标注 license 为cc-by-nc-4.0(非商业许可),这与"开源对标 Suno"的社区叙事之间存在一条需要创作者自己把握的红线。功能层面,README 提供了两条官方工作流——YuE2 Music Cover(零样本翻唱)与 YuE2 Text to Music(文字成曲),对应报告里两个硬核结论:翻唱评测用 948 首 SHS100K 未见作品,完整乐谱条件下的 CLEWS mAP 0.647 与 Discogs-VINet mAP 0.288 双双压过 SongEcho(0.419/0.122)与 ACE-Step 1.5;乐谱编辑则做到和声编辑达成率 79.54%、旋律 84.17%、节奏 73.43%,同时未编辑内容保留度维持在 90.16%–94.34%——"只换和声不动旋律"这类白盒操作有数据背书,而不是宣传话术。

回到标题的问题:Suno v5 该慌吗?更准确的说法是——当开源模型第一次在同一盲听协议、同一候选预算(约等于)下与 v5 打成平手、并在音频质量上占优时,商用闭源阵营的护城河已经从"音质"转移到了"版本迭代速度"与"生态封闭性"。YuE2 用一份 56 页的报告证明了一件事:把作曲显式写成可编辑的乐谱,不是牺牲音质换取可控性,而是两条路同时走通。至于 v6 之后 Suno 的回应,以及 YuE2 团队在 MERT2、SheetSage2 上的后续迭代,才是这场竞赛真正的下一回合。

【免费下载链接】Yue2项目地址: https://ai.gitcode.com/hf_mirrors/Comfy-Org/Yue2

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询