Muse Review 下载统一 CSV ↓
726 首歌曲的自动评测结果

人声和乐器比较稳定,情绪还不稳定

测试方法很简单。先给模型一组要求,例如 Folk、Piano 和一段 lyrics,让它生成歌曲。然后让 Qwen 听这首歌,看看这些要求有没有真的出现在音乐里。本页不分析 BPM。

一共测试了多少首歌
0
每首歌只计算一次,没有重复
其中多少首用于判断风格
0
其余样本只检查 BPM 或歌词语言
每 100 个风格要求
0
大约 68 个能在歌曲里被听出来
每 100 首歌
0
大约 62 首满足了输入的全部风格要求
四项可以直接比较的能力 越靠近外圈越容易控制

具体的要求更容易做到

男声、女声、钢琴和吉他都有比较清楚的声音特征,所以模型更容易生成,Qwen 也更容易听出来。情绪没有固定声音,歌词和编曲都可能改变它。

整首歌全部目标通过410 / 661 · 62.0%
单个风格目标命中590 / 864 · 68.3%
命中 590未命中 274
同样的要求,多生成几次会不会一样 117 组重复测试
72.6%稳定通过
85 稳定通过19 摇摆13 稳定失败

怎么理解:同样的 tags 和 lyrics 多生成几次,约 73% 的题每次都能通过。约 16% 的题时好时坏,说明重新生成一次,结果可能会变。

1输入要求

填写 tags 和 lyrics,例如 Folk、Piano 和一段歌词。

2生成歌曲

模型按照这些要求生成一首可以播放的歌。

3Qwen 听歌

Qwen 写出它听到的曲风、乐器和情绪,系统再和输入要求对照。

模型能控制哪些东西

人声最容易控制,情绪最难控制

可以把每个百分比理解成 100 次测试中大约成功了多少次。点击任一项目,可以在页面下方查看对应的具体 tags。

哪些要求最容易失败

情绪、音色和部分曲风最容易没被听出来

下面的柱子越高,说明这个 tag 在测试中被漏掉的次数越多。

怎么理解:失败并没有集中在某一个 tag 上。Warm 最多也只失败了 11 次。真正需要改进的是情绪、音色和曲风这几类能力。

一次提出多少个要求

tags 越多,模型越容易顾此失彼

只有一个要求时,约 67% 的歌曲可以做到。两个要求时降到约 56%。三个以上要求同时出现时,没有一首歌全部通过。

要求数量和通过率 不计算歌词语言

3 个以上风格目标

0 / 36

36 首歌都没能一次满足全部要求。不过,138 个单独目标中仍有 86 个被识别,命中率是 62.3%。模型通常能做到其中一部分,只是很难全部兼顾。

中文和英文有区别吗

目前看不出明显区别

英文题目的通过率是 53.6%,中文是 49.3%。这个差距还不足以说明模型更擅长英文。

Qwen 的判断有什么限制

Qwen 是自动听歌工具,不是绝对正确答案

Qwen 可能漏掉歌曲里真实存在的风格,也可能写出很多额外 tags。所以这些结果表示 Qwen 有没有听出目标,不等于人工听众一定会得出相同结论。

需要查某个 tag 时再看

具体 tags 的测试结果

这部分信息比较细,默认收起。只有在需要查询 Folk、Piano、Happy 等单个 tag 时再打开。

打开具体 tags 表格

样本数表示这个 tag 被测试了多少次。命中率表示每 100 次测试中,大约有多少次被 Qwen 听出来。少于 10 个样本的结果只作参考。

输入的 tag它属于哪一类测试次数被听出的比例可能的真实范围只在文字描述中出现
接下来应该做什么

先确认评测可信,再改进模型

如果 Qwen 自己判断不准,模型分数也会跟着失真。下一步要先把评测工具校准好。

1

人工复听一小部分歌曲

从通过和失败的歌曲中抽出 80 到 120 首,让人重新听一遍。这样可以知道 Qwen 大概会错多少次。

2

重点解决情绪和音色

情绪是最明确的模型短板。音色则要先统一词语的含义,再判断模型到底能不能控制。

3

以后固定使用同一套题

每个模型版本都跑相同的 tags、lyrics 和重复次数。只有题目不变,分数变化才方便解释。

给需要核对方法的人

技术口径和参考资料

普通读者不需要阅读这一部分。这里保留统计口径,方便技术人员复查。

打开技术说明
歌曲

一次真实的音乐生成。失败后重新生成,不会重复计入最终结果。

题目

一组固定的 tags 和 lyrics。正式总分让每道题拥有相同权重。

目标

输入中的一个指定 tag,例如 Folk、Piano 或 Calm。

正式统计还使用了可信区间和按题目抽样的方法,用来避免重复生成次数影响结论。BPM 完全排除,技术失败也不会算作模型没有命中。