zli12321/LHTB

Long Horizon Terminal Benchmark with Dense Reward Grading

Long‑Horizon Terminal‑Bench (LHTB)

是什麼 – LHTB 是一個研究型基準,用於評估大型語言模型(LLM)代理在 長時間運行 的終端式任務中的表現。它包含 46 個不同的任務,要求代理在 Docker 容器中持續工作數百步,而非產生一次輸出就停止。

為何重要 – 多數現有的程式碼或推理基準都是短周期的:模型寫一個腳本,測試執行,任務就結束了。LHTB 推動代理維持狀態、處理互動式程式,並在 90 分鐘(或更長)的預算內 恢復失敗。結果顯示,即使是最強的當前模型也只能解決其中一小部分任務,突顯了長期自主能力上的明顯差距。

核心元件

  • 任務集 – 46 個「Harbor」任務定義,涵蓋遊戲、多模態分析、逆向工程、科學模擬、地球能源系統、安全、研究重現以及專業 APEX 風格工作流程。
  • 修改版 Harbor 框架 – 開源 Harbor 評估框架的分支,增加了兩個關鍵功能:
    1. continue_until_timeout – 代理在每次嘗試後由框架重新調用隱藏驗證器,直到任務超時為止持續運行。
    2. 驗證器隔離 – 驗證器在獨立沙箱中執行,驗證期間代理的程序樹被凍結,防止代理窺探隱藏測試資料。
  • 排行榜與資料集 – 21 個前線模型(2026 年 7 月快照)的結果已發布在即時排行榜上,完整執行資料作為 Hugging Face 資料集提供。
  • 範例設定檔 – 提供可直接執行的 YAML 檔案,支援無 API 金鑰的「奧拉克爾」執行、OpenAI 相容 API、OpenRouter 以及完整基準測試執行。

如何使用

  1. 安裝框架 – 使用原始 harbor 套件(僅支援單次執行)或倉儲中提供的 LHTB 修補版本:
    pip install -e harbor   # 支援 continue‑until‑timeout 的可編輯安裝
    
  2. 克隆倉儲(Git LFS 用於大檔案)
    git lfs install
    git clone https://github.com/zli12321/LHTB.git
    cd LHTB
    git lfs pull
    
  3. 執行快速健康檢查(無需 API 金鑰):
    harbor run -c configs/examples/oracle_smoke.yaml
    
  4. 執行自己的代理 – 在環境變數中設定 API 金鑰並指向設定檔,例如:
    export OPENAI_API_KEY=sk-...
    harbor run -c configs/examples/terminus2_openai.yaml   # 執行子集
    
  5. 執行完整基準測試
    export OPENAI_API_KEY=sk-...
    harbor run -c configs/examples/full_benchmark.yaml
    
    結果將寫入 ./jobs/ 目錄。

結果快照(2026 年 7 月) – 最強模型(Grok 4.5)平均獎勵為 0.505,解決了 13/46 個任務。即使在 3 小時預算下,表現最佳的模型(GPT‑5.6‑sol)也僅達到平均獎勵 0.600,解決了 17/46 個任務,確認該基準尚未飽和。

進一步了解

授權 – Apache 2.0。


LHTB 是一個真正的、研究級的長周期 LLM 代理基準,而非簡單的教學或連結集合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案