huggingface/alignment-handbook

Robust recipes to align language models with human and AI preferences

解決する課題

The Alignment Handbook は、言語モデルを人間やAIの選好に合わせるための、標準化された堅牢なトレーニングレシピを提供します。これは、チャットモデルのトレーニングに関する公開リソースの不足を補うものであり、特にデータの収集方法や、単純な教師あり微調整 (SFT) を超えた高度なアライメント技術の使用方法に焦点を当てています。

仕組み

このプロジェクトは、主に2つのコンポーネントで構成されています。

  • Scripts: 分散トレーニング (DeepSpeed ZeRO-3経由) やパラメータ効率の良い微調整 (LoRA/QLoRA) をサポートするトレーニングおよび評価スクリプト。これらのスクリプトは、継続的な事前学習、SFT、そしてDPOやORPOなどの手法を用いた選好アライメントという、パイプライン全体をカバーしています。
  • Recipes: 特定のトレーニング実行に必要な正確なパラメータを含むYAML設定ファイル。これにより、Zephyr 7BやSmolLMのようなモデルを再現することが可能です。

対象読者

オープンソースのLLMをトレーニング、適応、またはアライメントし、指示に従わせたり特定の選好に適合させたりしたい機械学習の実務者や研究者向けに設計されています。

ハイライト

  • 包括的なパイプライン: 継続的な事前学習、SFT、報酬モデリング、拒否サンプリング、選好最適化をサポート。
  • 高度なアライメント技術: 直接選好最適化 (DPO)、オッズ比選好最適化 (ORPO)、憲法AI (Constitutional AI) を実装。
  • 再現性: 最先端の小型LLMやコーディングアシスタントを再現するための具体的なレシピを提供。
  • 柔軟なトレーニング: DeepSpeedを使用したフルウェイトトレーニングや、LoRA/QLoRAによる効率的な微調整をサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト