sapientinc/HRM-Text

HRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.

解決する課題

HRM-Text は、ゼロから基盤モデルを事前学習する際に伴う高い計算コストとデータコストという課題を解決します。従来のスケーリング則が示唆するよりも大幅に少ない計算量(130〜600分の1)とデータ量(150〜900分の1)を使用して、10億パラメータのテキスト生成モデルを作成できるようにし、はるかに低いコスト(約1,000ドル)で基盤モデルの事前学習を可能にします。

仕組み

本プロジェクトは、タスク完了と潜在空間推論によって強化された階層的リカレントアーキテクチャ(HRM)を実装しています。このフレームワークは、トレーニングを最適化するためにいくつかの高性能コンポーネントを利用しています:

  • アーキテクチャ: 標準的な Transformer ラッパーといくつかの再帰ベースラインを含む、さまざまな設定をサポートする階層的リカレントモデル。
  • トレーニングパイプライン: 分散トレーニングに PyTorch FSDP2 を使用し、アテンションパスに FlashAttention 3 カーネルを使用し、効率を向上させるために PrefixLM シーケンスパッキングを使用します。
  • データ処理: 事前学習コーパスのクリーニング、トークン化、層化サンプリングのために、付属の data_io パイプラインと統合されています。
  • ツール: 推論用のコンパイル済み生成エンジン、標準ベンチマーク(MMLU や GSM8k など)用の評価スクリプト、チェックポイントを Hugging Face Transformers 形式にエクスポートする変換ツールが含まれています。

対象者

大規模な LLM に通常必要とされる膨大なインフラと計算予算なしで、独自の基盤モデルをゼロから事前学習したいと考えている AI 研究者および開発者向けに設計されています。

ハイライト

  • 極限の効率性: 16台の H100 GPU で約46時間、1,500ドル未満で 1B モデルを事前学習。
  • 高性能: 推論および知識タスク全体で競争力のあるベンチマーク結果(例:XL モデルで GSM8k 84.7%)。
  • 完全なライフサイクルサポート: データ準備と事前学習から、評価および SFT(教師ありファインチューニング)までの完全なパイプラインを提供。
  • 柔軟なアーキテクチャ: 複数のモデルサイズ(B から XXL)およびさまざまなリカレントベースおよび Transformer ベースのアーキテクチャをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト