Hugging Face TRL と RapidFire AI の統合
Hugging Face TRL は、RapidFire AI と正式に統合され、Large Language Models (LLM) のファインチューニングとポストトレーニングを加速します。この統合により、開発者は大幅なコード変更や GPU ハードウェア要件の増加を必要とせず、単一の GPU でも複数のトレーニング構成を同時に比較できるようになります。
実験スループットの加速
RapidFire AI は、逐次構成テストと比較して実験速度を 16〜24 倍向上させます。この速度向上は、適応型チャンクベースのスケジューリングおよび実行スキームによって達成され、これにより複数の TRL 構成を同時に実行でき、チームは最適な評価指標により早く到達できるようになります。
| シナリオ | 逐次時間 | RapidFire AI 時間 | 速度向上 |
|---|---|---|---|
| 4 設定, 1 GPU | 120 分 | 7.5 分 | 16× |
| 8 設定, 1 GPU | 240 分 | 12 分 | 20× |
| 4 設定, 2 GPU | 60 分 | 4 分 | 15× |
テクニカルアーキテクチャとコア機能
RapidFire AI は、いくつかの主要なテクニカルメカニズムを通じて GPU の利用率と開発者ワークフローを最適化します:
適応型チャンクベースの同時トレーニング
RapidFire AI は、データセットを指定された数のチャンクにシャードし、チャンク境界で異なる LLM 構成を GPU を通じてサイクルします。このメカニズムは、逐次トレーニングよりもはるかに早く、すべての構成にわたる評価指標の増分シグナルを提供し、より迅速な比較意思決定を容易にします。
共有メモリオーケストレーション
安定性とパフォーマンスを維持するため、システムは効率的な共有メモリベースのアダプターおよびモデルのスピル/ロードメカニズムを使用して自動チェックポイントを行います。スケジューラーは、これらの共有メモリメカニズムを使用して利用可能な GPU 全体にわたって構成を自動的にオーケストレーションし、手動の配管の必要性をなくします。
インタラクティブコントロール操作 (IC Ops)
ユーザーはライブダッシュボードを介して実行中の実験を管理できます。IC Ops は開発者に次の操作を許可します:
- Stop: パフォーマンスが低い構成を終了してリソースを節約します。
- Resume: 一時停止された実行を再開します。
- Delete: 不要な実行を削除します。
- Clone-Modify: 有望な実行に基づいて新しい構成を作成し、ハイパーパラメータを変更し、オプションで親の重みからウォームスタートします。
TRL の統合と実装
RapidFire AI は、TRL トレーナー用のドロップインラッパーを提供し、ユーザーは既存の TRL モンタルモデルを維持しながら同時実行の利点を得られます。サポートされているトレーナーは次のとおりです:
- SFT:
RFSFTConfigを使用 - DPO:
RFDPOConfigを使用 - GRPO:
RFGRPOConfigを使用
実装例
単一の GPU で同時トレーニングを実装するには、ユーザーは RFModelConfig と RFLoraConfig を使用して config_set を定義し、指定された num_chunks で experiment.run_fit を介して実験を実行します。たとえば、2 GPU セットアップでは、RapidFire AI は比較意思決定にかかる時間を逐次約 15 分から同時 5 分に短縮し、GPU の利用率を 60% から 95% 以上に向上させます。
始め方
RapidFire AI は、pip install rapidfireai を使用して PyPI からインストールできます。初期設定では、Hugging Face CLI を介した認証と、rapidfireai init および rapidfireai start の実行が必要です。システムは、http://localhost:3000 でアクセス可能な MLflow ベースのダッシュボードを提供し、リアルタイムでの監視と制御を行います。今後、Trackio、W&B、TensorBoard のサポートも計画されています。