OpenAI Jukebox

OpenAI Jukeboxは、生のオーディオとして音楽を生成するニューラルネットワークで、さまざまなジャンルやアーティストのスタイル、さらには原始的な歌唱も合成できます。MIDIのようなノートを出力するシンボリック音楽ジェネレーターとは異なり、Jukeboxはオーディオを直接モデル化するため、人間の声や複雑な音色を捉えることができます。

技術的アプローチ: 階層的圧縮と生成

Jukeboxは、4分間のCD品質の楽曲が1000万以上のタイムステップを含むという生オーディオのモデリングの課題を、階層的オートエンコーダとトランスフォーマーベースの事前分布を使用することで克服しています。

VQ-VAEによる生オーディオ圧縮

Jukeboxは、Vector Quantized-Variational AutoEncoder(VQ-VAE)を使用して、44kHzの生オーディオを離散潜在空間に圧縮します。このモデルは、各レベルでコードブックサイズ2048の3段階の圧縮(8x、32x、128x)を採用しています。パフォーマンスを向上させるために、OpenAIは以下の3つの特定の改良を実装しました:

  • Random Restarts: コードブックの崩壊を防ぐため、使用頻度が一定のしきい値を下回ったコードブックベクトルは、エンコードされた隠れ状態にランダムにリセットされます。
  • Separate Decoders: 各レベルは独立したデコーダーを使用して入力を再構築し、上位レベルの有用性を最大化します。
  • Spectral Loss: 入力と再構築されたスペクトログラムの差をペナルティとするスペクトル損失関数が追加され、高周波数の再構築が助けられます。

スパーストランスフォーマーによる音楽生成

オーディオが圧縮された後、Sparse Transformersの簡略版バリアントに基づく3段階の自己回帰事前モデルが、これらのコードの分布を学習します:

  • Top-level Prior: 約8,192コード(約24秒のオーディオ)のコンテキストで、長距離構造と高レベルの意味(メロディと歌唱)をモデル化します。
  • Upsampling Priors: 続く2つのレベルが、局所的な音楽構造と音色を追加し、短いコンテキスト(それぞれ6秒と1.5秒)での音質を洗練させます。

条件付けとデータセット

Jukeboxは、LyricWikiからのメタデータと歌詞とペアになった120万曲の厳選されたデータセットで訓練されており、そのうち60万曲は英語です。このモデルは、生成を誘導するための3種類の条件付けをサポートしています:

  • アーティストとジャンル: アーティストとジャンルのラベルを提供することで、モデルは予測のエントロピーを減らし、特定のスタイルの音楽を生成できます。教師なしクラスタリング(t-SNEを使用)により、モデルは類似したアーティストとジャンルを自然にグループ化していることが示されます。
  • 歌詞: 未整列の歌詞に対応するため、Jukeboxは線形アライメントヒューリスティックを使用し、ヒップホップなどの高速なジャンルではSpleeterを使ってボーカルを抽出し、NUS AutoLyricsAlignで単語レベルのアライメントを行います。エンコーダ‑デコーダー注意層により、音楽デコーダーは歌詞エンコーダーに注意を向けることができます。

現在の制限

その能力にもかかわらず、Jukeboxは人間が作曲した音楽と比較していくつかの技術的および創造的なギャップがあります:

  • 大規模構造の欠如: ローカルなコヒーレンスとコードパターンは存在しますが、サビなどの繰り返される大規模な構造はまだ生成できません。
  • オーディオアーティファクト: ダウンサンプリングとアップサンプリングのプロセスにより、識別可能なノイズが導入されます。
  • サンプリング速度: 自己回帰的な性質のため、モデルは遅く、1分のオーディオをレンダリングするのに約9時間かかります。
  • データセットバイアス: 現在、訓練は主に英語の歌詞と西洋音楽に限定されています。

開発タイムライン

  • 2019年7月: ピアノやバイオリンなどの楽器を再現するための初期の生オーディオモデルが開発されました。
  • 2019年9月: アーティストとジャンルのラベルを含むデータセットが拡張され、長距離のコヒーレンスを持つフルレングスの楽曲が生成可能になりました。
  • 2020年1月: VQ-VAEが44kHzにスケールアップされ、トップレベルの事前分布が1Bから5Bパラメータに拡張され、より明瞭な歌唱と高い品質が実現されました。
  • 2020年1月: 歌詞条件付けが導入され、発音と歌唱のアライメントを学習できるようになりました。

Sources