simular-ai/Agent-S

Agent S: an open agentic framework that uses computers like a human

해결하고자 하는 문제

Agent S는 컴퓨터 그래픽 사용자 인터페이스(GUI)와 인간처럼 자연스럽고 효과적으로 상호작용할 수 있는 AI 에이전트를 만드는 어려움을 극복하기 위해 설계되었습니다. Windows, macOS, Linux 전반에 걸친 자율적인 컴퓨터 사용 프레임워크를 제공하여, 화면 내용을 해석하고 행동을 실행함으로써 에이전트가 복잡한 작업을 수행할 수 있게 합니다.

작동 원리

시스템은 Agent‑Computer Interface(ACI)를 사용해 고수준 에이전트 결정을 실행 가능한 명령으로 변환합니다. 일반적으로 듀얼 모델 아키텍처를 채택하는데, 메인 생성 모델(예: GPT‑5)이 고수준 추론을 담당하고, 특화된 그라운딩 모델(예: UI‑TARS)이 이러한 의도를 정확한 화면 좌표와 동작으로 매핑합니다. 또한 로컬 코딩 환경을 확장할 수 있어, 에이전트가 Python 및 Bash 코드를 실행해 데이터 처리나 시스템 자동화와 같이 GUI 상호작용보다 효율적인 작업을 수행할 수 있습니다.

대상

이 프로젝트는 자율 GUI 에이전트를 구축하는 개발자·연구자, AI로 수동 워크플로를 대체하고자 하는 자동화 엔지니어, 그리고 최첨단 컴퓨터 사용 에이전트(CUA)에 관심 있는 사람들을 위한 것입니다.

하이라이트

  • 인간 수준 성능: Agent S3는 OSWorld 벤치마크에서 인간 수준(72.60%)을 초과했습니다.
  • 크로스 플랫폼 지원: Windows, macOS, Linux에서 동작합니다.
  • 제로샷 일반화: WindowsAgentArena 및 AndroidWorld와 같은 특정 학습 없이도 새로운 환경에서 강력한 기능을 보여줍니다.
  • 하이브리드 인터랙션: GUI 상호작용과 로컬 코드 실행을 결합해 복잡한 시스템 작업을 처리합니다.