bytedance/UI-TARS-desktop

The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra

해결하는 문제

컴퓨터와 브라우저를 자연어 지시를 사용하여 제어할 수 있도록 합니다. 사용자 인터페이스(GUI)를 시각적 입력으로 처리함으로써, AI 에이전트가 모든 애플리케이션에 대해 수동 API 통합을 요구하지 않고도 항공권 예약, 소프트웨어 설정 조정, GitHub issues 확인과 같은 복잡한 작업을 수행할 수 있도록 합니다.

작동 방식

이 프로젝트는 두 가지 주요 구성 요소로 이루어져 있습니다:

  1. Agent TARS: Vision-Language Models (VLMs)를 CLI 및 Web UI와 통합한 멀티모달 AI 에이전트 스택입니다. 시각적 그래운딩(visual grounding), DOM 분석 또는 두 가지를 결합한 하이브리드 전략을 사용하여 브라우저를 제어합니다. 또한 Model Context Protocol (MCP) 서버와 통합되어 실제 도구에 연결할 수 있습니다.
  2. UI-TARS Desktop: 스크린샷과 시각적 인식을 기반으로 정밀한 마우스 및 키보드 제어를 제공하는 네이티브 애플리케이션입니다 (UI-TARS 모델 및 Seed-1.5-VL/1.6 시리즈 사용).

대상 사용자

  • 제공된 SDK를 사용하여 GUI 자동화 에이전트를 구축하려는 개발자.
  • 자연어를 사용하여 반복적인 데스크톱 또는 브라우저 작업을 자동화하려는 사용자.
  • 멀티모달 에이전트 및 GUI 상호작용을 위한 시각적 그래운딩에 관심 있는 연구자.

주요 특징

  • 하이브리드 브라우저 제어: GUI 기반 시각적 그래운딩 및 DOM 기반 상호작용 지원.
  • 원격 조작: 컴퓨터와 브라우저를 원격으로 제어하는 기능.
  • MCP 통합: Model Context Protocol을 기반으로 구축되어 외부 도구를 쉽게 마운트할 수 있음.
  • 크로스 플랫폼: Windows, MacOS 및 웹 브라우저에서 작동.
  • 로컬 처리: UI-TARS Desktop은 프라이버시가 보장되는 안전한 로컬 처리를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트