人声和乐器比较稳定,情绪还不稳定
测试方法很简单。先给模型一组要求,例如 Folk、Piano 和一段 lyrics,让它生成歌曲。然后让 Qwen 听这首歌,看看这些要求有没有真的出现在音乐里。本页不分析 BPM。
具体的要求更容易做到
男声、女声、钢琴和吉他都有比较清楚的声音特征,所以模型更容易生成,Qwen 也更容易听出来。情绪没有固定声音,歌词和编曲都可能改变它。
怎么理解:同样的 tags 和 lyrics 多生成几次,约 73% 的题每次都能通过。约 16% 的题时好时坏,说明重新生成一次,结果可能会变。
填写 tags 和 lyrics,例如 Folk、Piano 和一段歌词。
模型按照这些要求生成一首可以播放的歌。
Qwen 写出它听到的曲风、乐器和情绪,系统再和输入要求对照。
人声最容易控制,情绪最难控制
可以把每个百分比理解成 100 次测试中大约成功了多少次。点击任一项目,可以在页面下方查看对应的具体 tags。
情绪、音色和部分曲风最容易没被听出来
下面的柱子越高,说明这个 tag 在测试中被漏掉的次数越多。
怎么理解:失败并没有集中在某一个 tag 上。Warm 最多也只失败了 11 次。真正需要改进的是情绪、音色和曲风这几类能力。
tags 越多,模型越容易顾此失彼
只有一个要求时,约 67% 的歌曲可以做到。两个要求时降到约 56%。三个以上要求同时出现时,没有一首歌全部通过。
3 个以上风格目标
0 / 3636 首歌都没能一次满足全部要求。不过,138 个单独目标中仍有 86 个被识别,命中率是 62.3%。模型通常能做到其中一部分,只是很难全部兼顾。
目前看不出明显区别
英文题目的通过率是 53.6%,中文是 49.3%。这个差距还不足以说明模型更擅长英文。
Qwen 是自动听歌工具,不是绝对正确答案
Qwen 可能漏掉歌曲里真实存在的风格,也可能写出很多额外 tags。所以这些结果表示 Qwen 有没有听出目标,不等于人工听众一定会得出相同结论。
具体 tags 的测试结果
这部分信息比较细,默认收起。只有在需要查询 Folk、Piano、Happy 等单个 tag 时再打开。
打开具体 tags 表格
样本数表示这个 tag 被测试了多少次。命中率表示每 100 次测试中,大约有多少次被 Qwen 听出来。少于 10 个样本的结果只作参考。
| 输入的 tag | 它属于哪一类 | 测试次数 | 被听出的比例 | 可能的真实范围 | 只在文字描述中出现 |
|---|
先确认评测可信,再改进模型
如果 Qwen 自己判断不准,模型分数也会跟着失真。下一步要先把评测工具校准好。
人工复听一小部分歌曲
从通过和失败的歌曲中抽出 80 到 120 首,让人重新听一遍。这样可以知道 Qwen 大概会错多少次。
重点解决情绪和音色
情绪是最明确的模型短板。音色则要先统一词语的含义,再判断模型到底能不能控制。
以后固定使用同一套题
每个模型版本都跑相同的 tags、lyrics 和重复次数。只有题目不变,分数变化才方便解释。
技术口径和参考资料
普通读者不需要阅读这一部分。这里保留统计口径,方便技术人员复查。
打开技术说明
一次真实的音乐生成。失败后重新生成,不会重复计入最终结果。
一组固定的 tags 和 lyrics。正式总分让每道题拥有相同权重。
输入中的一个指定 tag,例如 Folk、Piano 或 Calm。
正式统计还使用了可信区间和按题目抽样的方法,用来避免重复生成次数影响结论。BPM 完全排除,技术失败也不会算作模型没有命中。