simular-ai/Agent-S
Agent S: an open agentic framework that uses computers like a human
해결하는 문제
Agent S는 AI 에이전트가 인간처럼 컴퓨터의 그래픽 사용자 인터페이스(GUI)를 조작할 수 있는 방법을 제공합니다. 에이전트가 화면을 인식하고 다양한 데스크톱 및 웹 애플리케이션에서 마우스, 키보드 및 스크롤 동작을 사용하여 상호 작용할 수 있도록 함으로써, 맞춤형 API 통합이나 앱별 스크립트 작성의 필요성을 제거합니다.
작동 방식
이 프레임워크는 주 생성 모델(예: GPT-5)과 특수 그라운딩 모델(예: UI-TARS)의 조합을 사용하여 자연어 지침을 실행 가능한 GUI 동작으로 변환합니다. 화면의 스크린샷을 캡처하고 분석하여 작업을 완료하는 데 필요한 클릭이나 키 입력을 결정합니다. 또한 데이터 처리나 시스템 자동화가 포함된 작업을 위해 Python 및 Bash 코드를 실행하도록 로컬 코딩 환경으로 구성할 수도 있습니다.
대상 독자
이 프로젝트는 OS 에이전트를 연구하는 연구원, 자신의 데스크톱 워크플로우를 자동화하려는 개발자, 그리고 오픈 소스 컴퓨터 사용 AI에 기여하는 기여자를 위해 설계되었습니다.
주요 특징
- 크로스 플랫폼 지원: macOS, Windows, Linux에서 작동합니다.
- 인간 수준의 성능: Agent S3는 OSWorld 벤치마크에서 인간의 성능을 처음으로 초과한 컴퓨터 사용 에이전트입니다 (72.60%).
- 모델 유연성: vLLM 또는 Open Router를 통해 OpenAI, Anthropic, Gemini 및 오픈 웨이트 제공업체의 모델과 호환됩니다.
- 통합 코딩 환경: 복잡한 시스템 작업을 위해 로컬에서 임의의 Python 및 Bash 코드를 실행할 수 있는 선택적 기능입니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트