facebookresearch/PhysicsLM4

Physics of Language Models: Part 4.2, Canon Layers at Scale where Synthetic Pretraining Resonates in Reality

何を解決するか

このプロジェクトは、言語モデルの物理学シリーズの研究コードとデータを提供し、特に大規模言語モデル(LLM)のアーキテクチャを改善するための「Canonレイヤー」の設計に焦点を当てています。合成事前学習実験と現実世界のパフォーマンスのギャップを埋め、特定のアーキテクチャ変更がモデルの能力と知識保存をどのように向上させるかを示します。

仕組み

このリポジトリは、いくつかの重要なアーキテクチャ的変更を実装し、その結果を再現するためのツールを提供しています:

  • Canonレイヤー:Transformerベースのモデル(例:Llama)および線形モデル(例:GLA、GDN、Mamba2)の両方に対応する「Canon-ABCD」と「Canon-AbCd」レイヤーを実装。
  • モデル実装LlamaCanon などのHugging Face互換モデルを提供。QK-normおよび部分的RoPEサポートを含む。
  • 最適化された学習:MetaのLinguaコードベースの修正版を使用し、効率的な事前学習を実現。z-lossおよびその他の安定性向上機能を統合。
  • 合成データと現実データ:合成データセット(Depo、Brevo、Capo、Mano、Lano)の生成ツールと、実世界の評価ベンチマーク(マルチホップ、Babilong)を提供し、モデルの知識の取得・保存能力を検証。

対象読者

このプロジェクトは、LLMの基本的なアーキテクチャ設計、スケーリング法則、モデルが階層構造を学習し知識を保存するメカニズム(物理学)に興味を持つAI研究者および実務家を主な対象としています。

主な特徴

  • アーキテクチャの革新:Transformerモデルと線形モデルの両方にCanonレイヤーを導入。
  • 包括的なベンチマーク:16のLlamaベースモデルおよび48の線形モデルの学習レシピと重みを提供。
  • クロスオーバー検証:合成事前学習の結果を現実世界の事前学習環境で検証。
  • 統合性:Hugging FaceおよびMetaのLinguaフレームワークとシームレスに統合。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト