Unreal Agent:通过异步 harness 降低 LLM 工具管理开销

Unreal Agent 通过将工具执行与模型推理循环解耦,降低了 AI Agent 的运营成本。通过实现异步 harness,它消除了底层 LLM 管理等待、轮询和心跳的需要,从而在真实工作负载中相比 Codex 节省高达 40% 的成本,相比 Pi 节省 20%。

异步工具调用架构

Unreal Agent 用异步事件日志系统取代了同步工具执行。在传统的代理 harness 中,模型经常浪费 token 来轮询长时间运行任务的状态,或在等待工具返回结果后再继续执行。

Unreal Agent 优化了这一过程,具体如下:

  • 立即状态记录:当调用工具时,harness 会立即追加一条事件日志记录,表明该工具处于「进行中」状态。
  • 后台执行:工具在后台继续执行,不会阻塞模型。
  • 并发工作:代理可以在单次模型调用中安排多个异构工具调用(例如,同时设置开发环境并搜索网络)。
  • 事件驱动恢复:一旦工具完成,结果将被追加到会话日志中,LLM 会被调用以处理输出。

该架构允许用户实时引导代理,而无需等待后台工具调用完成,从而减少了与生命周期管理相关的「token 税」。

性能与成本基准

使用 GPT-6 Astra(xhigh 推理努力)测试,Unreal Agent 在多个编码基准中表现出更高的成本效率和更低的 token 使用量,同时保持了具有竞争力的通过率。

Terminal-Bench 4.0

Unreal Agent 实现了 57.9% 的通过率,总成本为 $1,428,而 Codex 在相同通过率下成本为 $2,350。这表明在相同结果下总支出显著降低。

SWE-Atlas Codebase QnA

Unreal Agent 达到 65.8% 的通过率,总成本为 $936,优于 Codex(63.3% 通过率,$1,303)和 Pi(64.0% 通过率,$1,033)。

DeepSWE 1.1

Unreal Agent 实现了 72.4% 的通过率,总成本为 $1,367,优于 Codex(69.0% 通过率,$1,633)和 Pi(69.6% 通过率,$1,584)。

Agents’ Last Exam (ALE-CLI)

Unreal Agent 记录了 30.0% 的完整通过率,总成本为 $217,而 Codex 和 Pi 均记录了 29.0% 的完整通过率,但成本更高(分别为 $292 和 $262)。

工程权衡与设计哲学

Unreal Labs 指出现有面向 CLI 的 SDK 存在若干局限性,这促使了 Unreal Agent 的诞生:

  • 生产环境不匹配:许多 SDK 假设本地会话和子进程,难以在需要可靠取消和后台任务管理的生产环境中扩展。
  • 依赖风险:第三方 SDK 中复杂的依赖树引入了维护和供应链风险。
  • 安全性:团队认为,确定性环境约束(如沙箱主机和细粒度访问令牌)比 harness 层的安全钩子更可靠。

为最大化效率,Unreal Agent 避免使用子代理或复杂工作流,而是依赖简单的提示和 token 优化的工具结果。

社区见解与技术批评

开发者之间的讨论凸显了异步方法的潜力与陷阱:

  • 与程序化工具调用的对比:一些用户指出,这类似于「程序化工具调用」(PTC)或返回程序(例如 TypeScript)以异步调用工具,这一技术已被 AI 实验室探索。
  • 「轮询」问题:批评者指出,Codex 等竞争对手的高 token 使用量通常源于对轮询任务的「热循环」,而修复这些循环即可实现与 Unreal Agent 声称相似的节省。
  • 自托管视角:一些开发者认为,对于自托管模型的用户而言,成本优化是一种「反功能」,建议 harness 应优先优化使用非前沿模型完整上下文窗口的最佳结果。
  • 命名担忧:多位评论者指出,尽管该工具与游戏开发无关,但可能与 Epic Games 的 Unreal Engine 存在潜在商标冲突。

"标题图有点奇怪。不知为何他们将运行在 Astra xhigh 上的 harness 与使用 Astra max 的 Codex 进行比较?…… Codex 使用大量 token 的一大原因是它基本上对自身启动的轮询任务进行热循环,完全没有任何合理理由。"

可用性

Unreal Agent 以 Go 库形式提供直接集成,也提供 CLI 使用的运行器可执行文件,以及兼容 Harbor 框架的基准运行器。源代码托管在 GitHub 上:github.com/unreallabsai/unreal-agent。

Sources

相关