allenai/open-instruct

AllenAI's post-training codebase

何を解決するか

Open Instruct は、公開されているデータセットを使用して、一般的な事前学習済み言語モデルの指示微調整および後処理を統合的に実行するフレームワークを提供します。Tüluシリーズのような高品質な指示従いモデルの作成プロセスを、コード、レシピ、アーティファクトを提供することで、オープンかつ再現可能にすることを目指しています。

仕組み

このプロジェクトは、複数段階の後処理パイプラインを実装しています:

  • 教師あり微調整 (SFT):一貫したフォーマットの指示データセットを使用して、ベースモデルを微調整します。
  • 好み微調整:Direct Preference Optimization (DPO) と PPO を実装し、モデルを人間の好みに一致させます。
  • 検証可能な報酬を用いた強化学習 (RLVR):GRPO などの技術を用いて、検証可能な報酬を使用してモデルを訓練します。
  • パラメータ効率の良い微調整:LoRA と QLoRA をサポートし、よりアクセスしやすい微調整を実現します。

対象ユーザー

Tülu モデルを再現したい、またはオープンソース言語モデルに対して先進的な後処理技術(SFT、DPO、RLVR)を適用したい研究者や開発者。

特徴

  • 包括的なパイプライン:SFT から好み微調整、RLVR までをカバーする完全なプロセス。
  • Tülu モデルシリーズ:Tülu 1、2、3 シリーズのモデルのトレーニングレシピとチェックポイントを提供。
  • データの混入除去ツール:トレーニングデータと評価データの重複度を測定するスクリプトを含み、公正な評価を確保。
  • 広範なモデル対応:Llama 3.1 および OLMo 2 モデルと互換性あり。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト