Unreal Agent:透過非同步 harness 減少 LLM 工具管理的開銷
Unreal Agent 透過將工具執行與模型推理迴圈解耦,降低 AI 代理的運營成本。透過實作非同步 harness,它消除了底層 LLM 管理等待、輪詢和心跳的需要,使實際工作負載中的成本較 Codex 減少高達 40%,較 Pi 減少 20%。
非同步工具呼叫架構
Unreal Agent 以非同步事件日誌系統取代同步工具執行。在傳統代理 harness 中,模型經常浪費 token 來輪詢長時間執行任務的狀態,或等待工具返回結果後才繼續。
Unreal Agent 優化此流程如下:
- 立即狀態記錄:當呼叫工具時,harness 會立即附加事件日誌記錄,指出工具處於「進行中」狀態。
- 背景執行:工具在背景中繼續執行,不會阻塞模型。
- 並行工作:代理可在單一模型回合中排程多個異構工具呼叫(例如,同時設定開發環境並搜尋網路)。
- 事件驅動恢復:一旦工具完成,結果會附加至會話日誌,並呼叫 LLM 處理輸出。
此架構允許使用者即時引導代理,無需等待背景工具呼叫完成,從而降低與生命週期管理相關的「token 稅」。
性能與成本基準
使用 GPT-6 Astra(xhigh 推理努力)測試,Unreal Agent 在多個程式碼基準中展現更高的成本效率與更低的 token 使用量,同時維持競爭性的通過率。
Terminal-Bench 4.0
Unreal Agent 以 57.9% 的通過率達成總成本 $1,428,而 Codex 在相同通過率下成本為 $2,350。這代表相同結果下總支出大幅減少。
SWE-Atlas Codebase QnA
Unreal Agent 以 65.8% 的通過率達成總成本 $936,優於 Codex(63.3% 通過率,$1,303)與 Pi(64.0% 通過率,$1,033)。
DeepSWE 1.1
Unreal Agent 以 72.4% 的通過率達成總成本 $1,367,優於 Codex(69.0% 通過率,$1,633)與 Pi(69.6% 通過率,$1,584)。
Agents’ Last Exam (ALE-CLI)
Unreal Agent 以 30.0% 的完整通過率達成總成本 $217,而 Codex 與 Pi 均為 29.0% 的完整通過率,但成本更高(分別為 $292 與 $262)。
工程取捨與設計哲學
Unreal Labs 指出現有以 CLI 為導向的 SDK 存在若干限制,促使了 Unreal Agent 的誕生:
- 生產環境不匹配:許多 SDK 假設本地會話與子程序,使其在需要可靠取消與背景任務管理的生產環境中難以擴展。
- 依賴風險:第三方 SDK 中繁複的依賴樹帶來維護與供應鏈風險。
- 安全性:團隊認為,決定性環境限制(例如沙盒主機與細粒度存取權杖)比 harness 層的安全鉤子更為穩健。
為最大化效率,Unreal Agent 避免使用子代理或複雜工作流程,改以簡單提示與 token 優化的工具結果為基礎。
社群見解與技術批判
開發者之間的討論凸顯了非同步方法的潛力與陷阱:
- 與程式化工具呼叫的比較:部分使用者指出,這類似於「程式化工具呼叫」(PTC)或返回程式碼(例如 TypeScript)以非同步方式呼叫工具,此技術已由 AI 實驗室探索。
- 「輪詢」問題:批評者指出,Codex 等競爭對手的高 token 使用量通常源自於對輪詢任務的「熱迴圈」,而修復這些迴圈即可獲得與 Unreal Agent 所宣稱類似的節省效果。
- 自托管觀點:部分開發者認為,對於自托管模型者而言,成本優化是一種「反功能」,建議 harness 應優先以非前沿模型的完整上下文視窗,追求最佳可能結果。
- 命名疑慮:多位評論者指出,儘管此工具與遊戲開發無關,但可能與 Epic Games 的 Unreal Engine 存在商標衝突。
"標題圖表有點奇怪。不知為何他們將在 Astra xhigh 上運行的 harness 與使用 Astra max 的 Codex 進行比較?…… Codex 使用如此多 token 的一大原因在於它基本上對自己啟動的輪詢任務進行熱迴圈,完全沒有任何合理理由。"
可用性
Unreal Agent 可作為 Go 庫直接整合,也可作為 CLI 使用的執行檔,並提供與 Harbor 框架相容的基準測試執行器。原始碼託管於 GitHub:github.com/unreallabsai/unreal-agent。
Sources
相關
- 專案
- Dispatch
- Dispatch
- Dispatch
- Dispatch