zli12321/LHTB

Long Horizon Terminal Benchmark with Dense Reward Grading

Long‑Horizon Terminal‑Bench (LHTB)

是什么 – LHTB 是一个研究型基准,用于评估大语言模型(LLM)代理在 长时间运行 的基于终端的任务中的表现。它包含 46 个不同的任务,要求代理在 Docker 容器中持续工作数百步,而不是生成一次输出就停止。

为何重要 – 大多数现有的编码或推理基准都是短周期的:模型写一个脚本,测试运行,任务就完成了。LHTB 推动代理维持状态、处理交互式程序,并在 90 分钟(或更长)的预算内 恢复失败。结果显示,即使是最强的当前模型也只能解决其中一小部分任务,凸显了长期自主能力上的明显差距。

核心组件

  • 任务集 – 46 个“Harbor”任务定义,涵盖游戏、多模态分析、逆向工程、科学模拟、地球能源系统、安全、研究复现以及专业 APEX 风格工作流。
  • 修改版 Harbor 框架 – 开源 Harbor 评估框架的分支,增加了两个关键功能:
    1. continue_until_timeout – 代理在每个尝试后由框架重新调用隐藏验证器,直到任务超时为止持续运行。
    2. 验证器隔离 – 验证器在独立沙箱中运行,验证期间代理的进程树被冻结,防止代理窥探隐藏测试数据。
  • 排行榜与数据集 – 21 个前沿模型(2026 年 7 月快照)的结果已发布在实时排行榜上,完整运行数据作为 Hugging Face 数据集提供。
  • 示例配置 – 提供可直接运行的 YAML 文件,支持无 API 密钥的“奥拉克尔”运行、OpenAI 兼容 API、OpenRouter 以及完整基准测试运行。

如何使用

  1. 安装框架 – 使用原始 harbor 包(仅支持单次运行)或仓库中提供的 LHTB 修补版本:
    pip install -e harbor   # 支持 continue‑until‑timeout 的可编辑安装
    
  2. 克隆仓库(Git LFS 用于大文件)
    git lfs install
    git clone https://github.com/zli12321/LHTB.git
    cd LHTB
    git lfs pull
    
  3. 运行快速健康检查(无需 API 密钥):
    harbor run -c configs/examples/oracle_smoke.yaml
    
  4. 运行自己的代理 – 在环境变量中设置 API 密钥并指向配置文件,例如:
    export OPENAI_API_KEY=sk-...
    harbor run -c configs/examples/terminus2_openai.yaml   # 运行子集
    
  5. 运行完整基准测试
    export OPENAI_API_KEY=sk-...
    harbor run -c configs/examples/full_benchmark.yaml
    
    结果将写入 ./jobs/ 目录。

结果快照(2026 年 7 月) – 最强模型(Grok 4.5)平均奖励为 0.505,解决了 13/46 个任务。即使在 3 小时预算下,表现最佳的模型(GPT‑5.6‑sol)也仅达到平均奖励 0.600,解决了 17/46 个任务,确认该基准尚未饱和。

了解更多

许可证 – Apache 2.0。


LHTB 是一个真正的、研究级别的长周期 LLM 代理基准,而非简单的教程或链接集合。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目