NVIDIA/RULER

This repo contains the source code for RULER: What’s the Real Context Size of Your Long-Context Language Models?

解決的問題

RULER 提供了一種衡量大型語言模型 (LLM) "有效" 上下文窗口的嚴謹方法。許多模型聲稱支援極長上下文(例如 128k token),但即使它們通過了簡單的 "needle-in-a-haystack"(大海撈針)測試,隨著輸入長度的增加,性能往往也會大幅下降。RULER 能夠識別模型性能實際開始下降的臨界點。

工作原理

它透過四個任務類別生成合成評估範例,以測試具有可配置序列長度和複雜程度的模型:

  • Retrieval: 測試尋找特定資訊的能力(例如,在乾草堆中尋找多個「針」)。
  • Multi-hop Tracing: 追蹤長文本中的變數名稱綁定鏈。
  • Aggregation: 提取常用詞或計算詞頻。
  • Question Answering: 使用 SQuAD 和 HotpotQA 等數據集測試長上下文中的理解能力。

適用對象

需要超越簡單的召回測試,對 LLM 實際長上下文能力進行基準測試的 AI 研究人員和開發人員,以確保模型能夠處理其聲稱的序列長度。

亮點

  • 超越簡單召回: 超越基礎的「大海撈針」測試,評估長序列上的複雜推理和聚合能力。
  • 可配置的複雜性: 允許使用者調整任務難度(例如,鏈中的跳數或要尋找的針的數量)。
  • 廣泛的基準測試: 包含大量開源和專有模型的結果。
  • 可擴展性: 為貢獻者添加新的合成任務和評估指標提供了清晰的流水線。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案