音频转 MIDI 到底有多准?按乐器分类的真实数据
MelodyTrace 底层 Basic Pitch 模型的已发表基准数据——按乐器(人声、吉他、钢琴、合成器、管弦乐)分类的准确率、各项指标含义,以及如何得到更干净的结果。
MelodyTrace 的采谱引擎是 Basic Pitch——Spotify 开源的、不针对特定乐器的音频转 MIDI 模型。与其说一句"效果很好",不如把这个模型自己经过同行评审的基准测试结果原样摆出来:哪里强、哪里弱,让你在上传文件之前心里有数,也方便你判断该用哪个转换工具页面更贴合你的素材。
数据来源
以下不是我们自己的内部数据,而是该模型 ICASSP 2022 论文的已发表结果:A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation(Bittner、Bosch、Rubinstein、Meseguer-Brocal、Ewert,Spotify / IRCAM),在标准公开数据集上用 mir_eval 库的 MIREX 采谱评测指标测得:
- Acc(帧级音高准确率)——每 10 毫秒的时间片上,正确的音符是否处于激活状态
- F(不含 offset)——论文的主要采谱评测指标:只要音高在四分之一音程以内、起音时刻与参考值相差在 50 毫秒以内,就算这个音符判定正确,不考虑音符何时结束
- F(严格版)——在上一条基础上,还要求音符的结束时刻(offset)落在真实时长的 20% 误差范围内
三项指标均为 0–100%,数值越高越好。
与"乐器专用工具"的对比
论文还把这个通用模型和只针对单一乐器的专用工具做了对比——如果你在纠结"通用转换器够不够用,还是得找专用工具",这组数据更有参考价值:
| 素材类型 | 通用模型(Basic Pitch) | 乐器专用工具 |
|---|---|---|
| 独奏吉他 | Acc 71.7% · F(no offset) 84.0% · F 65.0% | TENT(仅吉他):Acc 63.2% · F(no offset) 76.3% · F 54.6% |
| 人声 | Acc 62.6% · F(no offset) 52.3% · F 34.6% | Vocano(仅人声):Acc 61.6% · F(no offset) 64.2% · F 51.3% |
| 独奏钢琴 | Acc 37.5% · F(no offset) 70.9% · F 10.5% | Onsets & Frames(仅钢琴):Acc 43.8% · F(no offset) 95.2% · F 36.4% |
三个诚实的结论:
- 吉他是这个模型的真实强项。 通用模型在全部三项指标上都超过了专门做吉他采谱的工具——详见 吉他转 MIDI。
- 人声的原始音高准确率相差不大(62.6% vs 61.6%),但音符切分明显落后(F(no offset) 52.3% vs 64.2%)。预期音高大体准确,但在滑音、颤音附近的音符起止边界可能需要手动修正——详见 人声转 MIDI 和 哼唱转 MIDI。
- 钢琴是模型最明显的弱项。 专用钢琴工具在严格 F 指标上的分数几乎是通用模型的 3.5 倍(36.4% vs 10.5%)。如果你要采钢琴独奏,请为钢琴卷帘编辑预留真实的时间——详见 MP3 转钢琴 MIDI。
按更宽泛乐器类别划分的准确率
在论文的完整(非独奏专属)测试集上,同一个模型还报告了:
| 乐器类别 | Acc | F(no offset) | F |
|---|---|---|---|
| 吉他(独奏+合奏) | 70% | 79% | 30% |
| 人声 | 63% | 52% | 35% |
| 管弦乐 | 53% | 49% | 35% |
| 合成器 | 44% | 42% | 21% |
| 钢琴 | 38% | 71% | 11% |
这对你上传的文件意味着什么
- 干净的单旋律素材——单一旋律线、独唱人声、独奏吉他、主奏乐器——最接近上面这些数字。这个模型是在分离出的单轨上评测的,不是完整混音。
- 密集的复音素材(完整乐队混音、管弦乐全奏)产生的多余/漏检音符会比这些基准数字暗示的更多,因为真实混音里多种乐器叠加在一起的组合,并不在模型的评测范围内。想先分离出目标声部,可参考 歌曲转 MIDI。
- 钢琴卷帘编辑器的存在,正是因为有这组数据,而不是因为工具"半成品"。 即便是论文里最好的成绩,也没有任何一种乐器达到 100%。移动、删除音符,调整灵敏度后重新采谱——这才是把"AI 的第一遍结果"变成可用乐谱的正常第二步,而不是工具有缺陷时的补救办法;今天任何一套自动采谱(AMT)系统都是如此。
参考文献
Bittner, R. M., Bosch, J. J., Rubinstein, D., Meseguer-Brocal, G., & Ewert, S. (2022). A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation. Proceedings of ICASSP 2022. arXiv:2203.09893 · github.com/spotify/basic-pitch