NVIDIA/RULER

This repo contains the source code for RULER: What’s the Real Context Size of Your Long-Context Language Models?

解決する課題

RULERは、大規模言語モデル(LLM)の「有効な」コンテキストウィンドウを測定するための厳格な方法を提供します。多くのモデルは非常に長いコンテキスト(例:128kトークン)をサポートしていると主張していますが、単純な「needle-in-a-haystack」テストに合格したとしても、入力長が増えるにつれて大幅なパフォーマンスの低下を招くことがよくあります。RULERは、モデルのパフォーマンスが実際に低下し始める箇所を特定します。

仕組み

設定可能なシーケンス長と複雑さのレベルでモデルをテストするために、4つのタスクカテゴリにわたって合成評価例を生成します:

  • Retrieval: 特定の情報を見つける能力のテスト(例:干し草の中の複数の「針」)。
  • Multi-hop Tracing: 長いテキスト全体にわたる変数名のバインディングチェーンの追跡。
  • Aggregation: 共通の単語の抽出または単語頻度の計算。
  • Question Answering: SQuADやHotpotQAなどのデータセットを使用して、長文コンテキストにおける理解度をテスト。

対象者

モデルが主張するシーケンス長を実際に処理できることを確認するために、単純な想起テストを超えてLLMの実際の長文コンテキスト能力をベンチマークする必要があるAI研究者および開発者。

ハイライト

  • 単純な想起を超えて: 基本的なneedle-in-a-haystackテストを超え、長いシーケンスにおける複雑な推論と集計を評価します。
  • 設定可能な複雑さ: ユーザーがタスクの難易度(例:チェーン内のホップ数や見つけるべき針の数)を調整できます。
  • 幅広いベンチマーク: 幅広いオープンソースおよびプロプライエタリなモデルの結果が含まれています。
  • 拡張性: コントリビューターが新しい合成タスクや評価指標を追加するための明確なパイプラインを提供します。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト