Natooz/MidiTok
MIDI / symbolic music tokenizers for Deep Learning models 🎶
What it solves
MidiTok は、音楽ファイル(MIDI と abc)を機械学習モデル(Transformer など)が理解できるトークン列に変換する標準化された方法を提供します。これにより、音楽生成、転写、あるいは Music Information Retrieval(MIR)といったタスクで、複雑な音楽トークナイズ手法を手作業で実装する必要がなくなります。
How it works
このライブラリは、REMI、MIDI‑Like、CPWord など、さまざまな既存の音楽トークナイズ手法を実装しています。ユーザーは音楽をトークンとして表現する際のパラメータを自由に設定できます。さらに、Byte Pair Encoding(BPE)、Unigram、WordPiece といった手法による高度な語彙学習をサポートし、データ拡張ツールや Hugging Face Hub との統合機能も提供して、モデルの共有を容易にします。
Who it’s for
AI 音楽生成、音楽転写、Music Information Retrieval(MIR)に取り組む研究者や開発者で、ディープラーニングモデルの学習用に音楽データセットを準備したい方に最適です。
Highlights
- Multiple Tokenization Schemes: REMI、REMI+、TSD、MuMIDI など、業界標準の多数のトークナイズ方式をサポート。
- Hugging Face Integration: Hugging Face Hub とシームレスに統合し、事前学習済みトークナイザーのプッシュ・ダウンロードが可能。
- Trainable Vocabularies: BPE、Unigram、WordPiece を用いたトークナイザーの学習が可能で、音楽表現を最適化。
- PyTorch Ready: PyTorch 用データセットやデータローダーを簡単に作成できるユーティリティを内蔵し、モデル訓練をスムーズに行えます。