allenai/OLMo-core

PyTorch building blocks for the OLMo ecosystem

解決する課題

OLMo-coreは、OLMoファミリーの大規模言語モデルを開発、トレーニング、および推論するために必要な基礎的なビルディングブロックとトレーニングインフラストラクチャを提供します。公式スクリプトと最適化されたハードウェアカーネルとの統合により、高性能なモデルのトレーニングプロセスを簡素化します。

仕組み

このライブラリは、コアとなるモデリングおよびトレーニングフレームワークとして機能します。FlashAttention、TransformerEngine、fused-linear loss用のLiger-Kernel、およびfloat8トレーニング用のtorchaoを含む、いくつかの高性能バックエンドと統合してメモリと速度を最適化します。また、grouped_gemmを介してMixture-of-Experts (MoE) モデルもサポートしています。ユーザーはtorchrunまたはBeaker CLIを介して公式スクリプトを使用してトレーニングを開始したり、Hugging Face Transformers、vLLM、またはライブラリ独自の組み込み生成ツールを通じて推論を実行したりできます。

対象者

このプロジェクトは、大規模言語モデルをゼロからトレーニングする、または既存のOLMoチェックポイントのトレーニング(アニーリング)を継続するAI研究者およびエンジニア向けに設計されています。

ハイライト

  • 公式トレーニングスクリプト: OLMo-2およびOLMo-3モデルファミリー用のすぐに使えるスクリプトが含まれています。
  • ハードウェア最適化: float8トレーニングと低メモリfused-linear lossをサポートしています。
  • 柔軟な推論: vLLMやHugging Face Transformersなどの業界標準ツールと互換性があります。
  • MoEサポート: dropless mixture-of-expertsモデルの機能が含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト