zli12321/LHTB
Long Horizon Terminal Benchmark with Dense Reward Grading
Long‑Horizon Terminal‑Bench (LHTB)
是什么 – LHTB 是一个研究型基准,用于评估大语言模型(LLM)代理在 长时间运行 的基于终端的任务中的表现。它包含 46 个不同的任务,要求代理在 Docker 容器中持续工作数百步,而不是生成一次输出就停止。
为何重要 – 大多数现有的编码或推理基准都是短周期的:模型写一个脚本,测试运行,任务就完成了。LHTB 推动代理维持状态、处理交互式程序,并在 90 分钟(或更长)的预算内 恢复失败。结果显示,即使是最强的当前模型也只能解决其中一小部分任务,凸显了长期自主能力上的明显差距。
核心组件
- 任务集 – 46 个“Harbor”任务定义,涵盖游戏、多模态分析、逆向工程、科学模拟、地球能源系统、安全、研究复现以及专业 APEX 风格工作流。
- 修改版 Harbor 框架 – 开源 Harbor 评估框架的分支,增加了两个关键功能:
continue_until_timeout– 代理在每个尝试后由框架重新调用隐藏验证器,直到任务超时为止持续运行。- 验证器隔离 – 验证器在独立沙箱中运行,验证期间代理的进程树被冻结,防止代理窥探隐藏测试数据。
- 排行榜与数据集 – 21 个前沿模型(2026 年 7 月快照)的结果已发布在实时排行榜上,完整运行数据作为 Hugging Face 数据集提供。
- 示例配置 – 提供可直接运行的 YAML 文件,支持无 API 密钥的“奥拉克尔”运行、OpenAI 兼容 API、OpenRouter 以及完整基准测试运行。
如何使用
- 安装框架 – 使用原始
harbor包(仅支持单次运行)或仓库中提供的 LHTB 修补版本:pip install -e harbor # 支持 continue‑until‑timeout 的可编辑安装 - 克隆仓库(Git LFS 用于大文件):
git lfs install git clone https://github.com/zli12321/LHTB.git cd LHTB git lfs pull - 运行快速健康检查(无需 API 密钥):
harbor run -c configs/examples/oracle_smoke.yaml - 运行自己的代理 – 在环境变量中设置 API 密钥并指向配置文件,例如:
export OPENAI_API_KEY=sk-... harbor run -c configs/examples/terminus2_openai.yaml # 运行子集 - 运行完整基准测试:
结果将写入export OPENAI_API_KEY=sk-... harbor run -c configs/examples/full_benchmark.yaml./jobs/目录。
结果快照(2026 年 7 月) – 最强模型(Grok 4.5)平均奖励为 0.505,解决了 13/46 个任务。即使在 3 小时预算下,表现最佳的模型(GPT‑5.6‑sol)也仅达到平均奖励 0.600,解决了 17/46 个任务,确认该基准尚未饱和。
了解更多
- 博客文章: https://zli12321.github.io/LHTB/
- 论文(arXiv): https://arxiv.org/abs/2607.08964
- 实时排行榜: https://zli12321.github.io/LHTB/leaderboard.html
- 数据集: https://huggingface.co/datasets/IntelligenceLab/Long-Horizon-Terminal-Bench
许可证 – Apache 2.0。
LHTB 是一个真正的、研究级别的长周期 LLM 代理基准,而非简单的教程或链接集合。
相关
- 项目
- 项目
- 项目
- 项目
- 项目