Hugging Face TRL と RapidFire AI の統合

Hugging Face TRL は、RapidFire AI と正式に統合され、Large Language Models (LLM) のファインチューニングとポストトレーニングを加速します。この統合により、開発者は大幅なコード変更や GPU ハードウェア要件の増加を必要とせず、単一の GPU でも複数のトレーニング構成を同時に比較できるようになります。

実験スループットの加速

RapidFire AI は、逐次構成テストと比較して実験速度を 16〜24 倍向上させます。この速度向上は、適応型チャンクベースのスケジューリングおよび実行スキームによって達成され、これにより複数の TRL 構成を同時に実行でき、チームは最適な評価指標により早く到達できるようになります。

シナリオ 逐次時間 RapidFire AI 時間 速度向上
4 設定, 1 GPU 120 分 7.5 分 16×
8 設定, 1 GPU 240 分 12 分 20×
4 設定, 2 GPU 60 分 4 分 15×

テクニカルアーキテクチャとコア機能

RapidFire AI は、いくつかの主要なテクニカルメカニズムを通じて GPU の利用率と開発者ワークフローを最適化します:

適応型チャンクベースの同時トレーニング

RapidFire AI は、データセットを指定された数のチャンクにシャードし、チャンク境界で異なる LLM 構成を GPU を通じてサイクルします。このメカニズムは、逐次トレーニングよりもはるかに早く、すべての構成にわたる評価指標の増分シグナルを提供し、より迅速な比較意思決定を容易にします。

共有メモリオーケストレーション

安定性とパフォーマンスを維持するため、システムは効率的な共有メモリベースのアダプターおよびモデルのスピル/ロードメカニズムを使用して自動チェックポイントを行います。スケジューラーは、これらの共有メモリメカニズムを使用して利用可能な GPU 全体にわたって構成を自動的にオーケストレーションし、手動の配管の必要性をなくします。

インタラクティブコントロール操作 (IC Ops)

ユーザーはライブダッシュボードを介して実行中の実験を管理できます。IC Ops は開発者に次の操作を許可します:

  • Stop: パフォーマンスが低い構成を終了してリソースを節約します。
  • Resume: 一時停止された実行を再開します。
  • Delete: 不要な実行を削除します。
  • Clone-Modify: 有望な実行に基づいて新しい構成を作成し、ハイパーパラメータを変更し、オプションで親の重みからウォームスタートします。

TRL の統合と実装

RapidFire AI は、TRL トレーナー用のドロップインラッパーを提供し、ユーザーは既存の TRL モンタルモデルを維持しながら同時実行の利点を得られます。サポートされているトレーナーは次のとおりです:

  • SFT: RFSFTConfig を使用
  • DPO: RFDPOConfig を使用
  • GRPO: RFGRPOConfig を使用

実装例

単一の GPU で同時トレーニングを実装するには、ユーザーは RFModelConfigRFLoraConfig を使用して config_set を定義し、指定された num_chunksexperiment.run_fit を介して実験を実行します。たとえば、2 GPU セットアップでは、RapidFire AI は比較意思決定にかかる時間を逐次約 15 分から同時 5 分に短縮し、GPU の利用率を 60% から 95% 以上に向上させます。

始め方

RapidFire AI は、pip install rapidfireai を使用して PyPI からインストールできます。初期設定では、Hugging Face CLI を介した認証と、rapidfireai init および rapidfireai start の実行が必要です。システムは、http://localhost:3000 でアクセス可能な MLflow ベースのダッシュボードを提供し、リアルタイムでの監視と制御を行います。今後、Trackio、W&B、TensorBoard のサポートも計画されています。

Sources