NVIDIA/RULER

This repo contains the source code for RULER: What’s the Real Context Size of Your Long-Context Language Models?

解决的问题

RULER 提供了一种衡量大型语言模型 (LLM) "有效" 上下文窗口的严谨方法。许多模型声称支持极长上下文(例如 128k token),但即使它们通过了简单的 "needle-in-a-haystack"(大海捞针)测试,随着输入长度的增加,性能往往也会大幅下降。RULER 能够识别模型性能实际开始下降的临界点。

工作原理

它通过四个任务类别生成合成评估示例,以测试具有可配置序列长度和复杂程度的模型:

  • Retrieval: 测试寻找特定信息的能力(例如,在干草堆中寻找多个“针”)。
  • Multi-hop Tracing: 追踪长文本中的变量名绑定链。
  • Aggregation: 提取常用词或计算词频。
  • Question Answering: 使用 SQuAD 和 HotpotQA 等数据集测试长上下文中的理解能力。

适用对象

需要超越简单的召回测试,对 LLM 实际长上下文能力进行基准测试的 AI 研究人员和开发人员,以确保模型能够处理其声称的序列长度。

亮点

  • 超越简单召回: 超越基础的“大海捞针”测试,评估长序列上的复杂推理和聚合能力。
  • 可配置的复杂性: 允许用户调整任务难度(例如,链中的跳数或要寻找的针的数量)。
  • 广泛的基准测试: 包含大量开源和专有模型的结果。
  • 可扩展性: 为贡献者添加新的合成任务和评估指标提供了清晰的流水线。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目