MelodyTrace
返回博客

音频转 MIDI 到底有多准?按乐器分类的真实数据

MelodyTrace 底层 Basic Pitch 模型的已发表基准数据——按乐器(人声、吉他、钢琴、合成器、管弦乐)分类的准确率、各项指标含义,以及如何得到更干净的结果。

2026年9月19日MelodyTrace Editorial

MelodyTrace 的采谱引擎是 Basic Pitch——Spotify 开源的、不针对特定乐器的音频转 MIDI 模型。与其说一句"效果很好",不如把这个模型自己经过同行评审的基准测试结果原样摆出来:哪里强、哪里弱,让你在上传文件之前心里有数,也方便你判断该用哪个转换工具页面更贴合你的素材。

数据来源

以下不是我们自己的内部数据,而是该模型 ICASSP 2022 论文的已发表结果:A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation(Bittner、Bosch、Rubinstein、Meseguer-Brocal、Ewert,Spotify / IRCAM),在标准公开数据集上用 mir_eval 库的 MIREX 采谱评测指标测得:

  • Acc(帧级音高准确率)——每 10 毫秒的时间片上,正确的音符是否处于激活状态
  • F(不含 offset)——论文的主要采谱评测指标:只要音高在四分之一音程以内、起音时刻与参考值相差在 50 毫秒以内,就算这个音符判定正确,不考虑音符何时结束
  • F(严格版)——在上一条基础上,还要求音符的结束时刻(offset)落在真实时长的 20% 误差范围内

三项指标均为 0–100%,数值越高越好。

与"乐器专用工具"的对比

论文还把这个通用模型和只针对单一乐器的专用工具做了对比——如果你在纠结"通用转换器够不够用,还是得找专用工具",这组数据更有参考价值:

素材类型通用模型(Basic Pitch)乐器专用工具
独奏吉他Acc 71.7% · F(no offset) 84.0% · F 65.0%TENT(仅吉他):Acc 63.2% · F(no offset) 76.3% · F 54.6%
人声Acc 62.6% · F(no offset) 52.3% · F 34.6%Vocano(仅人声):Acc 61.6% · F(no offset) 64.2% · F 51.3%
独奏钢琴Acc 37.5% · F(no offset) 70.9% · F 10.5%Onsets & Frames(仅钢琴):Acc 43.8% · F(no offset) 95.2% · F 36.4%

三个诚实的结论:

  1. 吉他是这个模型的真实强项。 通用模型在全部三项指标上都超过了专门做吉他采谱的工具——详见 吉他转 MIDI
  2. 人声的原始音高准确率相差不大(62.6% vs 61.6%),但音符切分明显落后(F(no offset) 52.3% vs 64.2%)。预期音高大体准确,但在滑音、颤音附近的音符起止边界可能需要手动修正——详见 人声转 MIDI哼唱转 MIDI
  3. 钢琴是模型最明显的弱项。 专用钢琴工具在严格 F 指标上的分数几乎是通用模型的 3.5 倍(36.4% vs 10.5%)。如果你要采钢琴独奏,请为钢琴卷帘编辑预留真实的时间——详见 MP3 转钢琴 MIDI

按更宽泛乐器类别划分的准确率

在论文的完整(非独奏专属)测试集上,同一个模型还报告了:

乐器类别AccF(no offset)F
吉他(独奏+合奏)70%79%30%
人声63%52%35%
管弦乐53%49%35%
合成器44%42%21%
钢琴38%71%11%

这对你上传的文件意味着什么

  • 干净的单旋律素材——单一旋律线、独唱人声、独奏吉他、主奏乐器——最接近上面这些数字。这个模型是在分离出的单轨上评测的,不是完整混音。
  • 密集的复音素材(完整乐队混音、管弦乐全奏)产生的多余/漏检音符会比这些基准数字暗示的更多,因为真实混音里多种乐器叠加在一起的组合,并不在模型的评测范围内。想先分离出目标声部,可参考 歌曲转 MIDI
  • 钢琴卷帘编辑器的存在,正是因为有这组数据,而不是因为工具"半成品"。 即便是论文里最好的成绩,也没有任何一种乐器达到 100%。移动、删除音符,调整灵敏度后重新采谱——这才是把"AI 的第一遍结果"变成可用乐谱的正常第二步,而不是工具有缺陷时的补救办法;今天任何一套自动采谱(AMT)系统都是如此。

参考文献

Bittner, R. M., Bosch, J. J., Rubinstein, D., Meseguer-Brocal, G., & Ewert, S. (2022). A Lightweight Instrument-Agnostic Model for Polyphonic Note Transcription and Multipitch Estimation. Proceedings of ICASSP 2022. arXiv:2203.09893 · github.com/spotify/basic-pitch