返回博客
音频转乐谱:AI转录能做到什么(不能做到什么)

音频转乐谱:AI转录能做到什么(不能做到什么)

MIDI Lab2026年9月5日·1 分钟阅读
sheet-musicnotationai-transcriptionmusic-production

把一段录音变成一份乐谱

以前要做乐谱,意味着请一位扒谱师:一个人一个音一个音地听录音,然后手写出整份乐谱。AI转录工具现在能自动完成同样的"听写"过程——分析一段音频文件,弄清楚里面弹的是什么,然后据此生成标准记谱。

这确实是个很有用的捷径。但说实话,这也是一种猜测——一种有根据的猜测,但终究是猜测。在把输出当成一份成品乐谱之前,值得先搞清楚这个过程实际在做什么。

AI到底在做什么

给定一段原始音频,转录需要仅凭这段波形同时解决好几个问题:

  • 音高——识别任意时刻正在响的是哪个音,即便多个音重叠在一起。
  • 节奏——弄清楚每个音持续多久、相对于拍子落在什么位置。
  • 调性与拍号——推断整首曲子所处的整体音乐框架,就像音乐人靠耳朵判断调性一样。
  • 该保留什么、该舍弃什么——面对不止一件纯净乐器的情况,AI必须判断哪条是"主"旋律线,因为以目前的工具水平,想可靠地把密集混音里每个同时进行的声部都转录出来是做不到的。

这些都不是照本宣科地"读谱",而是自动完成的解读。正因如此,结果应该被当作一份有分量的初稿,而不是成品——一个能带你走完大半段路的起点,之后还需要人工再过一遍。

在哪些情况下效果最好

转录的准确度基本上直接取决于AI需要理清多少东西:

  • 独奏旋律线——单一清晰的乐器或人声,没有别的声部争夺注意力。
  • 钢琴——旋律与伴奏结合在一起,尤其是在中等速度下。
  • 单一乐器录音——吉他、小提琴、长笛,任何单声部或接近单声部的乐器。
  • 中等速度——非常快的段落更难被准确量化成干净的节奏记谱。

在哪些情况下会吃力

  • 密集和弦与厚重和声,多个音重叠在一起,AI必须判断哪些是重要的。
  • 经过大量处理或失真的乐器,音高本身的内容更难被分离出来。
  • 全乐队或管弦乐混音,实际可行的做法通常是提取出最突出的旋律线,而不是尝试把每个声部都完整转录出来。
  • 复合节奏的素材,其底层的律动本身即便对人耳来说也是模糊不清的。

如何使用转录结果

把一份转录当作初稿,而不是成品乐谱。演奏法(音符怎么演奏——断奏、连奏、重音)、力度(强弱)和装饰音(倚音、颤音)是最可能需要事后在记谱软件里手工修整的细节。省下的时间仍然是实打实的——以前专业扒谱师要花几个小时的活,现在几分钟就能完成,最后再做一些打磨,而不是从零开始转录。

为什么这不只是个有趣的话题

书面乐谱至今仍是音乐协作实际发生的重要方式——伴奏乐手、影视配乐监制、老师和管弦乐团通常都是靠一份乐谱而不是一段录音来工作的。把"我凭耳朵做出了这个"和"这是一份别人能读懂的谱子"之间的鸿沟填上,能打开一些纯粹靠音频工作的制作人很难触及的场景。

这项功能在 MIDI Lab 中的定位

MIDI 转乐谱(参见相关文章)是更直接的情况,因为音符已经是已知的,而不需要推断。但同样的理念也适用于音频:MIDI Lab 的会话本身就可以将音频文件作为附件保存,把这段录音转换成乐谱是同一对话流程中自然而然的下一步——不需要单独的转录工具,不需要单独的模式,只需"上传你已有的内容,描述你想要的效果",就像音频和 MIDI 附件现在已经实现的那样。

如果你用的是MIDI而不是原始音频——一段生成的音轨、一段录制的MIDI演奏——记谱问题会简单得多,因为音符本来就是已知的,而不需要被推断出来。参见为什么MIDI转乐谱是这个问题里更简单的一种。