Natooz/MidiTok
MIDI / symbolic music tokenizers for Deep Learning models 🎶
What it solves
MidiTok 提供一種標準化的方式,將音樂檔案(MIDI 與 abc)轉換成機器學習模型(如 Transformer)能理解的 token 序列。這消除了在音樂生成、轉錄或音樂資訊檢索(MIR)等任務中手動實作複雜音樂 token 化方案的需求。
How it works
此函式庫實作了多種已確立的音樂 token 化方法(例如 REMI、MIDI‑Like、CPWord)。使用者可以自行設定音樂如何以 token 形式表示的各項參數。此外,它亦支援使用 Byte Pair Encoding(BPE)、Unigram、WordPiece 等技術進行進階詞彙訓練,並提供資料增強工具與 Hugging Face Hub 整合,以便共享模型。
Who it’s for
從事 AI 音樂生成、音樂轉錄與音樂資訊檢索(MIR)研究與開發的研究者與開發者,需要為深度學習模型的訓練準備音樂資料集。
Highlights
- Multiple Tokenization Schemes: 支援包括 REMI、REMI+、TSD、MuMIDI 在內的眾多業界標準 token 化方案。
- Hugging Face Integration: 無縫整合 Hugging Face Hub,讓使用者能推送與下載預訓練的 tokenizer。
- Trainable Vocabularies: 可使用 BPE、Unigram、WordPiece 訓練 tokenizer,以獲得最佳的音樂表示。
- PyTorch Ready: 內建實用工具,可快速建立 PyTorch dataset 與 data loader,簡化模型訓練流程。