# 音频转多轨 MIDI(草稿)

把整曲混音拆分为鼓/贝斯/其他/人声,逐轨转成 MIDI——多轨扒谱的起点

> 标准页面: https://elysiatools.com/zh/tools/audio-to-multitrack-midi

- **分类:** Media

- **关键词:** 音频, midi, 转写, 多轨, demucs, basic-pitch, 分轨, 音乐, 扒谱

## 概述

仅供测试:此工具资源消耗较高,所有分轨选项的音频长度均限制为最多 20 秒。它用两个神经网络把整曲混音变成多轨 MIDI 草稿:HT-Demucs FT(ONNX)把音频分离成鼓、贝斯、其他乐器和人声;Spotify 的 Basic Pitch(TensorFlow.js)再把每轨转成 MIDI 音符。各轨拼成一个 .mid 文件,每轨一个乐器音色。这是人工扒谱的草稿/起点,不是完美扒谱,会有漏音、时间漂移和乐器串扰。把结果导入 DAW 手动清理即可。纯 Node 运行,无需 Python,无需 GPU。

## 输入项

- **音频文件** (file): 上传 MP3、WAV、FLAC、M4A、OGG 或 AAC 文件(仅供测试,最长 20 秒)
- **要转写的轨道** (select)
- **起音灵敏度** (number)
- **帧灵敏度** (number)
- **最短音符长度(帧)** (number)
- **包含弯音** (checkbox)

## 适用场景

- 需要从短篇整曲混音中快速获得鼓、贝斯、其他乐器或人声的 MIDI 草稿时。
- 只想提取人声旋律，生成单轨 MIDI 进行后续分析或编辑时。
- 希望先获得多轨扒谱基础，再导入 DAW 手动修正音符和节奏时。

## 工作原理

- 上传 MP3、WAV、FLAC、M4A、OGG 或 AAC 音频，长度限制为最多 20 秒。
- 工具使用 HT-Demucs FT 将混音分离为鼓、贝斯、其他乐器和人声轨道。
- 使用 Basic Pitch 分析选定轨道中的音符，并根据起音灵敏度、帧灵敏度和最短音符长度生成 MIDI。
- 将各轨道合并为一个 .mid 文件；如启用弯音选项，输出中会包含弯音信息。

## 使用案例

- 音乐制作人从短篇混音中提取多轨 MIDI，作为 DAW 编曲和修订的基础。
- 扒谱人员先转写人声或旋律轨，再手动校正音高、节奏和音符长度。
- 音乐学习者将片段转换为 MIDI，辅助观察不同声部的音符分布。

## 常见问题

### 支持哪些音频格式？

支持 MP3、WAV、FLAC、M4A、OGG 和 AAC。

### 音频长度有什么限制？

该测试工具每次仅支持最长 20 秒的音频片段。

### 可以只转写人声吗？

可以，在“要转写的轨道”中选择“仅人声”，输出单轨旋律 MIDI。

### 输出是什么文件？

输出是一个 .mid 文件，其中可包含按乐器划分的多条 MIDI 轨道。

### 生成的 MIDI 是否准确无误？

不是。结果属于扒谱草稿，可能存在漏音、时间漂移和乐器串扰，建议导入 DAW 后手动清理。

## 相关工具

- [音频旋律轮廓提取器](https://elysiatools.com/zh/tools/audio-melody-contour-extractor): 从音频中提取主导旋律，并在一个 ZIP 中导出 MIDI、音符事件、音高轮廓、SVG 和 JSON。
- [批量音频转换器](https://elysiatools.com/zh/tools/audio-batch-converter): 批量转换多个音频文件格式，支持 MP3、WAV、FLAC、AAC、OGG、Opus，支持质量设置和批量处理
- [音频编码切换](https://elysiatools.com/zh/tools/audio-codec-swap): 在选定输出格式内更换音频编码
- [音频和弦进行检测器](https://elysiatools.com/zh/tools/audio-chord-progression-detector): 在本地估算音频中的和弦顺序，并以 ZIP 下载 CSV、JSON、SVG 时间线和方法说明。
- [音频转文字转录器 (AI)](https://elysiatools.com/zh/tools/audio-to-text-transcriber): 用 grok-stt AI 模型将语音(wav/mp3/m4a/flac/ogg/webm/aac)转录为文本、SRT、VTT 或 JSON。最长 10 分钟。
- [音频格式转换器](https://elysiatools.com/zh/tools/audio-converter): 在不同音频格式之间转换文件，如 MP3、WAV、FLAC、AAC、OGG，支持质量设置和音量调节
- [音频重采样](https://elysiatools.com/zh/tools/audio-resample): 修改音频采样率（如 44.1kHz 到 22.05kHz）
- [音频声道调整](https://elysiatools.com/zh/tools/audio-channel-resample): 更改声道数（单声道/立体声），保持原格式

## 示例

- [无版权FLAC音频样本](https://elysiatools.com/zh/samples/flac-samples): 用于测试与开发的 FLAC 无损音频样本集合，包含自然声音与冥想音乐
- [无版权MP3音频样本](https://elysiatools.com/zh/samples/mp3-samples): 免费使用和测试的无版权音频样本集合，包括自然声音、冥想音乐和环境音频，适用于测试和开发目的
- [无版权WAV音频样本](https://elysiatools.com/zh/samples/wav-samples): 用于测试与开发的未压缩 WAV 音频样本集合，包含自然声音与冥想音乐
- [无版权M4A音频样本](https://elysiatools.com/zh/samples/m4a-samples): Apple iTunes兼容的M4A音频样本集合，经过优化实现质量与文件大小的平衡

## 相关内容

- [卡拉 OK 与音轨分离工具](https://elysiatools.com/zh/hubs/karaoke-and-stem-separation-tools): 分离人声与伴奏，清理得到的音轨，控制平衡，并交付可用于卡拉 OK 或混音的音频。
