bytedance/UI-TARS-desktop
The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra
解決的問題
它實現了使用自然語言指令來控制電腦與瀏覽器。透過將使用者介面 (GUI) 視為視覺輸入,它允許 AI 智能體執行複雜的任務——例如預訂航班、調整軟體設定或檢查 GitHub issues——而無需為每個應用程式進行手動 API 整合。
工作原理
該專案由兩個主要部分組成:
- Agent TARS:一個將視覺語言模型 (VLMs) 與 CLI 及 Web UI 整合的多模態 AI 智能體技術棧。它使用混合策略,透過視覺接地 (visual grounding)、DOM 分析或兩者的結合來控制瀏覽器。它還與 Model Context Protocol (MCP) 伺服器整合,以連接到現實世界的工具。
- UI-TARS Desktop:一個原生應用程式,使用 UI-TARS 模型(以及 Seed-1.5-VL/1.6 系列)根據螢幕截圖與視覺識別提供精確的滑鼠與鍵盤控制。
適用對象
- 希望使用提供的 SDK 構建 GUI 自動化智能體的開發人員。
- 希望使用自然語言自動執行重複性桌面或瀏覽器任務的使用者。
- 對多模態智能體與用於 GUI 互動的視覺接地感興趣的研究人員。
亮點
- 混合瀏覽器控制:支援基於 GUI 的視覺接地與基於 DOM 的互動。
- 遠端操作:能夠遠端控制電腦與瀏覽器。
- MCP 整合:基於 Model Context Protocol 構建,可以輕鬆掛載外部工具。
- 跨平台:適用於 Windows、MacOS 與網路瀏覽器。
- 本地處理:UI-TARS Desktop 提供隱私且安全的本地處理。
相關
- 專案
- 專案
- 專案
- 專案
- 專案