OpenDCAI/DataFlex

Data-centric LLM training with dynamic sample selection, domain mixture optimization, and example reweighting inside the LLaMA-Factory training loop.

何を解決するか

DataFlexは、LLM最適化プロセスにおけるトレーニングデータの管理の難しさに対処します。固定されたデータセットを使用するのではなく、開発者がトレーニング中にどのサンプルを使用するか、どのように混合するか、そしてモデルの学習プロセスにどの程度の重みを割り当てるかを動的に調整できるようにします。これにより、モデルのパフォーマンスが向上し、実験の再現性も高まります。

仕組み

LLaMA-Factoryの上に構築された動的トレーニングフレームワークとして、DataFlexは複数のデータ中心のトレーニング戦略を統合した一元化されたシステムです。以下の3つのコア機能の再現可能な実装を提供します:

  • データ選択:勾配ベース(LESS、NICE)や損失ベースの戦略に基づき、動的にトレーニングサンプルを選択し、『難しい』サンプルに注目します。
  • データ混合:トレーニング中に異なるドメイン(例:DOREMIやODMの使用)からのデータの比率を調整し、異なる種類の情報を最適なバランスにします。
  • データ再重み付け:バックプロパゲーション中にサンプルの重みを変更し、モデルが好む特定のデータポイントに重点を置きます。

対象ユーザー

トレーニングデータのスケジューリングと最適化に対してより柔軟で強力な制御を求める、大規模言語モデル(LLM)をトレーニングする研究者や開発者。

特徴

  • LLaMA-Factory統合:LLaMA-Factoryの即時置き換えとして動作し、完全な互換性を維持します。
  • 統一フレームワーク:再現が難しい複数の研究リポジトリを一つの場所に統合します。
  • スケーラビリティ:DeepSpeed ZeRO-3による勾配計算をサポートし、より大規模なモデルのトレーニングが可能になります。
  • データ中心アプローチ:単なる前処理ではなく、トレーニングループ中のデータスケジューリングに焦点を当てます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト