zli12321/LHTB
Long Horizon Terminal Benchmark with Dense Reward Grading
Long‑Horizon Terminal‑Bench (LHTB)
是什麼 – LHTB 是一個研究型基準,用於評估大型語言模型(LLM)代理在 長時間運行 的終端式任務中的表現。它包含 46 個不同的任務,要求代理在 Docker 容器中持續工作數百步,而非產生一次輸出就停止。
為何重要 – 多數現有的程式碼或推理基準都是短周期的:模型寫一個腳本,測試執行,任務就結束了。LHTB 推動代理維持狀態、處理互動式程式,並在 90 分鐘(或更長)的預算內 恢復失敗。結果顯示,即使是最強的當前模型也只能解決其中一小部分任務,突顯了長期自主能力上的明顯差距。
核心元件
- 任務集 – 46 個「Harbor」任務定義,涵蓋遊戲、多模態分析、逆向工程、科學模擬、地球能源系統、安全、研究重現以及專業 APEX 風格工作流程。
- 修改版 Harbor 框架 – 開源 Harbor 評估框架的分支,增加了兩個關鍵功能:
continue_until_timeout– 代理在每次嘗試後由框架重新調用隱藏驗證器,直到任務超時為止持續運行。- 驗證器隔離 – 驗證器在獨立沙箱中執行,驗證期間代理的程序樹被凍結,防止代理窺探隱藏測試資料。
- 排行榜與資料集 – 21 個前線模型(2026 年 7 月快照)的結果已發布在即時排行榜上,完整執行資料作為 Hugging Face 資料集提供。
- 範例設定檔 – 提供可直接執行的 YAML 檔案,支援無 API 金鑰的「奧拉克爾」執行、OpenAI 相容 API、OpenRouter 以及完整基準測試執行。
如何使用
- 安裝框架 – 使用原始
harbor套件(僅支援單次執行)或倉儲中提供的 LHTB 修補版本:pip install -e harbor # 支援 continue‑until‑timeout 的可編輯安裝 - 克隆倉儲(Git LFS 用於大檔案):
git lfs install git clone https://github.com/zli12321/LHTB.git cd LHTB git lfs pull - 執行快速健康檢查(無需 API 金鑰):
harbor run -c configs/examples/oracle_smoke.yaml - 執行自己的代理 – 在環境變數中設定 API 金鑰並指向設定檔,例如:
export OPENAI_API_KEY=sk-... harbor run -c configs/examples/terminus2_openai.yaml # 執行子集 - 執行完整基準測試:
結果將寫入export OPENAI_API_KEY=sk-... harbor run -c configs/examples/full_benchmark.yaml./jobs/目錄。
結果快照(2026 年 7 月) – 最強模型(Grok 4.5)平均獎勵為 0.505,解決了 13/46 個任務。即使在 3 小時預算下,表現最佳的模型(GPT‑5.6‑sol)也僅達到平均獎勵 0.600,解決了 17/46 個任務,確認該基準尚未飽和。
進一步了解
- 博客文章: https://zli12321.github.io/LHTB/
- 論文(arXiv): https://arxiv.org/abs/2607.08964
- 即時排行榜: https://zli12321.github.io/LHTB/leaderboard.html
- 資料集: https://huggingface.co/datasets/IntelligenceLab/Long-Horizon-Terminal-Bench
授權 – Apache 2.0。
LHTB 是一個真正的、研究級的長周期 LLM 代理基準,而非簡單的教學或連結集合。
相關
- 專案
- 專案
- 專案
- 專案
- 專案