bytedance/UI-TARS-desktop

The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra

解決する課題

コンピュータやブラウザを自然言語の指示で制御できるようにします。ユーザーインターフェース(GUI)を視覚的入力として扱うことで、AIエージェントが、すべてのアプリケーションに対して手動でAPI統合を行うことなく、航空券の予約、ソフトウェア設定の調整、GitHub issuesの確認といった複雑なタスクを実行できるようにします。

仕組み

このプロジェクトは、主に2つのコンポーネントで構成されています。

  1. Agent TARS: Vision-Language Models (VLMs) を CLI および Web UI と統合したマルチモーダルAIエージェントスタックです。視覚的グラウンディング、DOM分析、またはその両方の組み合わせを使用して、ブラウザを制御するハイブリッド戦略を採用しています。また、Model Context Protocol (MCP) サーバーと統合し、現実世界のツールに接続することも可能です。
  2. UI-TARS Desktop: スクリーンショットと視覚認識に基づき、精密なマウスおよびキーボード操作を提供するネイティブアプリケーションです(UI-TARS モデルおよび Seed-1.5-VL/1.6 シリーズを使用)。

対象者

  • 提供される SDK を使用して GUI 自動化エージェントを構築したい開発者。
  • 自然言語を使用して、反復的なデスクトップやブラウザのタスクを自動化したいユーザー。
  • マルチモーダルエージェントや GUI 操作のための視覚的グラウンディングに関心のある研究者。

ハイライト

  • ハイブリッドブラウザ制御: GUIベースの視覚的グラウンディングと DOMベースのインタラクションをサポート。
  • リモート操作: コンピュータやブラウザを遠隔操作する機能。
  • MCP 統合: Model Context Protocol に基づいて構築されており、外部ツールを簡単にマウント可能。
  • クロスプラットフォーム: Windows、MacOS、およびウェブブラウザに対応。
  • ローカル処理: UI-TARS Desktop は、プライバシーに配慮した安全なローカル処理を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト