bytedance/UI-TARS-desktop
The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra
解決する課題
コンピュータやブラウザを自然言語の指示で制御できるようにします。ユーザーインターフェース(GUI)を視覚的入力として扱うことで、AIエージェントが、すべてのアプリケーションに対して手動でAPI統合を行うことなく、航空券の予約、ソフトウェア設定の調整、GitHub issuesの確認といった複雑なタスクを実行できるようにします。
仕組み
このプロジェクトは、主に2つのコンポーネントで構成されています。
- Agent TARS: Vision-Language Models (VLMs) を CLI および Web UI と統合したマルチモーダルAIエージェントスタックです。視覚的グラウンディング、DOM分析、またはその両方の組み合わせを使用して、ブラウザを制御するハイブリッド戦略を採用しています。また、Model Context Protocol (MCP) サーバーと統合し、現実世界のツールに接続することも可能です。
- UI-TARS Desktop: スクリーンショットと視覚認識に基づき、精密なマウスおよびキーボード操作を提供するネイティブアプリケーションです(UI-TARS モデルおよび Seed-1.5-VL/1.6 シリーズを使用)。
対象者
- 提供される SDK を使用して GUI 自動化エージェントを構築したい開発者。
- 自然言語を使用して、反復的なデスクトップやブラウザのタスクを自動化したいユーザー。
- マルチモーダルエージェントや GUI 操作のための視覚的グラウンディングに関心のある研究者。
ハイライト
- ハイブリッドブラウザ制御: GUIベースの視覚的グラウンディングと DOMベースのインタラクションをサポート。
- リモート操作: コンピュータやブラウザを遠隔操作する機能。
- MCP 統合: Model Context Protocol に基づいて構築されており、外部ツールを簡単にマウント可能。
- クロスプラットフォーム: Windows、MacOS、およびウェブブラウザに対応。
- ローカル処理: UI-TARS Desktop は、プライバシーに配慮した安全なローカル処理を提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト