Natooz/MidiTok

MIDI / symbolic music tokenizers for Deep Learning models 🎶

What it solves

MidiTok は、音楽ファイル(MIDI と abc)を機械学習モデル(Transformer など)が理解できるトークン列に変換する標準化された方法を提供します。これにより、音楽生成、転写、あるいは Music Information Retrieval(MIR)といったタスクで、複雑な音楽トークナイズ手法を手作業で実装する必要がなくなります。

How it works

このライブラリは、REMI、MIDI‑Like、CPWord など、さまざまな既存の音楽トークナイズ手法を実装しています。ユーザーは音楽をトークンとして表現する際のパラメータを自由に設定できます。さらに、Byte Pair Encoding(BPE)、Unigram、WordPiece といった手法による高度な語彙学習をサポートし、データ拡張ツールや Hugging Face Hub との統合機能も提供して、モデルの共有を容易にします。

Who it’s for

AI 音楽生成、音楽転写、Music Information Retrieval(MIR)に取り組む研究者や開発者で、ディープラーニングモデルの学習用に音楽データセットを準備したい方に最適です。

Highlights

  • Multiple Tokenization Schemes: REMI、REMI+、TSD、MuMIDI など、業界標準の多数のトークナイズ方式をサポート。
  • Hugging Face Integration: Hugging Face Hub とシームレスに統合し、事前学習済みトークナイザーのプッシュ・ダウンロードが可能。
  • Trainable Vocabularies: BPE、Unigram、WordPiece を用いたトークナイザーの学習が可能で、音楽表現を最適化。
  • PyTorch Ready: PyTorch 用データセットやデータローダーを簡単に作成できるユーティリティを内蔵し、モデル訓練をスムーズに行えます。