Unreal Agent: 비동기 허브를 통한 LLM 도구 관리 부담 감소

Unreal Agent는 모델의 추론 루프에서 도구 실행을 분리함으로써 AI 에이전트의 운영 비용을 줄입니다. 비동기 허브를 구현함으로써, 기반 LLM이 대기, 풀링, 하트비트를 관리할 필요가 없어지며, 실제 워크로드에서 Codex 대비 최대 40%, Pi 대비 최대 20%의 비용 절감 효과를 얻을 수 있습니다.

비동기 도구 호출 아키텍처

Unreal Agent는 동기적 도구 실행을 비동기 이벤트 로그 시스템으로 대체합니다. 전통적인 에이전트 허브에서는 모델이 오랜 실행 시간을 가진 작업의 상태를 풀링하거나 도구가 결과를 반환하기를 기다리는 동안 토큰을 낭비하는 경우가 많습니다.

Unreal Agent는 다음과 같은 방식으로 이 과정을 최적화합니다:

  • 즉시 상태 기록: 도구가 호출되면 허브는 즉시 도구가 "진행 중"임을 기록합니다.
  • 백그라운드 실행: 도구는 모델을 차단하지 않고 백그라운드에서 계속 실행됩니다.
  • 병렬 작업: 에이전트는 한 번의 모델 턴 안에서 다양한 도구 호출(예: 개발 환경 설정과 동시에 웹 검색)을 동시에 스케줄링할 수 있습니다.
  • 이벤트 기반 재개: 도구가 완료되면 결과가 세션 로그에 추가되고, LLM이 출력을 처리하도록 호출됩니다.

이 아키텍처는 백그라운드 도구 호출이 완료되기를 기다리지 않고 실시간으로 에이전트를 조정할 수 있게 하며, 라이프사이클 관리와 관련된 "토큰 세금"을 줄입니다.

성능 및 비용 벤치마크

GPT-6 Astra (xhigh 추론 노력)를 사용하여 테스트한 결과, Unreal Agent는 여러 코딩 벤치마크에서 경쟁력 있는 성공률을 유지하면서도 더 높은 비용 효율성과 낮은 토큰 사용량을 보였습니다.

Terminal-Bench 4.0

Unreal Agent는 총 비용 $1,428로 57.9%의 성공률을 달성했으며, Codex는 동일한 57.9% 성공률을 $2,350의 비용으로 달성했습니다. 동일한 결과를 얻기 위해 소요되는 총 지출이 크게 감소했습니다.

SWE-Atlas Codebase QnA

Unreal Agent는 총 비용 $936로 65.8%의 성공률을 달성했으며, Codex(63.3% 성공률, $1,303)와 Pi(64.0% 성공률, $1,033)를 모두 상회했습니다.

DeepSWE 1.1

Unreal Agent는 총 비용 $1,367로 72.4%의 성공률을 달성했으며, Codex(69.0% 성공률, $1,633)와 Pi(69.6% 성공률, $1,584)보다 우수했습니다.

Agents’ Last Exam (ALE-CLI)

Unreal Agent는 총 비용 $217로 30.0%의 완전 성공률을 기록했으며, Codex와 Pi는 각각 29.0%의 완전 성공률을 $292와 $262의 비용으로 달성했습니다.

엔지니어링 트레이드오프와 디자인 철학

Unreal Labs는 기존 CLI 중심 SDK의 몇 가지 한계가 Unreal Agent의 개발을 촉발했다고 지적합니다:

  • 생산 환경 불일치: 많은 SDK는 로컬 세션과 서브프로세스를 전제로 하며, 신뢰할 수 있는 취소 및 백그라운드 작업 관리가 필요한 생산 환경에서는 확장하기 어렵습니다.
  • 의존성 리스크: 제3자 SDK의 복잡한 의존성 트리로 인해 유지보수 및 공급망 리스크가 증가합니다.
  • 보안: 팀은 사전 정의된 환경 제약(예: 사전 격리된 호스트, 세밀한 액세스 토큰)이 허브 수준의 보안 훅보다 더 견고하다고 주장합니다.

효율성을 극대화하기 위해 Unreal Agent는 서브에이전트나 복잡한 워크플로우를 피하고, 단순한 프롬프트와 토큰 최적화된 도구 결과에 의존합니다.

커뮤니티 인사이트 및 기술적 비판

개발자들 사이의 논의는 비동기 접근 방식의 잠재력과 단점 양쪽 모두를 강조합니다:

  • 프로그래밍 도구 호출과의 비교: 일부 사용자는 이 방식이 "프로그래밍 도구 호출"(PTC) 또는 비동기적으로 도구를 호출하기 위해 프로그램(예: TypeScript)을 반환하는 것과 유사하다고 지적하며, 이 기법은 이미 AI 연구소에서 탐구되고 있습니다.
  • "풀링" 문제: 비판자들은 Codex와 같은 경쟁 제품의 높은 토큰 사용량이 주로 시작한 풀링 작업에 대해 "핫 루핑"을 하는 데 기인하며, 이러한 루프를 수정하면 Unreal Agent가 주장하는 절감 효과와 유사한 결과를 얻을 수 있다고 지적합니다.
  • 자체 호스팅 관점: 일부 개발자는 자체 호스팅 모델을 사용하는 경우 비용 최적화는 "역기능"이라고 주장하며, 비선두 모델의 전체 컨텍스트 창을 활용해 가능한 최고의 결과를 얻는 데 초점을 맞추는 것이 더 바람직하다고 제안합니다.
  • 이름에 대한 우려: 여러 댓글에서 Epic Games의 Unreal Engine과의 상표 충돌 가능성에 대해 언급했지만, 이 도구는 게임 개발과 아무런 관련이 없다고 밝혔습니다.

"헤드라인 그래프는 좀 이상합니다. 왜 Astra xhigh에서 실행되는 자신의 허브를 Astra max로 실행되는 Codex와 비교하는지 모르겠네요... Codex가 토큰을 너무 많이 사용하는 주된 이유는 시작한 풀링 작업에 대해 거의 무의미한 이유로 핫 루핑을 하는 것이죠."

사용 가능 여부

Unreal Agent는 직접 통합을 위한 Go 라이브러리, CLI 사용을 위한 러너 실행 파일, Harbor 프레임워크와 호환되는 벤치마크 러너로 제공됩니다. 소스 코드는 GitHub에서 github.com/unreallabsai/unreal-agent에 호스팅되어 있습니다.

Sources

관련