bytedance/UI-TARS-desktop

The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra

解決的問題

它實現了使用自然語言指令來控制電腦與瀏覽器。透過將使用者介面 (GUI) 視為視覺輸入,它允許 AI 智能體執行複雜的任務——例如預訂航班、調整軟體設定或檢查 GitHub issues——而無需為每個應用程式進行手動 API 整合。

工作原理

該專案由兩個主要部分組成:

  1. Agent TARS:一個將視覺語言模型 (VLMs) 與 CLI 及 Web UI 整合的多模態 AI 智能體技術棧。它使用混合策略,透過視覺接地 (visual grounding)、DOM 分析或兩者的結合來控制瀏覽器。它還與 Model Context Protocol (MCP) 伺服器整合,以連接到現實世界的工具。
  2. UI-TARS Desktop:一個原生應用程式,使用 UI-TARS 模型(以及 Seed-1.5-VL/1.6 系列)根據螢幕截圖與視覺識別提供精確的滑鼠與鍵盤控制。

適用對象

  • 希望使用提供的 SDK 構建 GUI 自動化智能體的開發人員。
  • 希望使用自然語言自動執行重複性桌面或瀏覽器任務的使用者。
  • 對多模態智能體與用於 GUI 互動的視覺接地感興趣的研究人員。

亮點

  • 混合瀏覽器控制:支援基於 GUI 的視覺接地與基於 DOM 的互動。
  • 遠端操作:能夠遠端控制電腦與瀏覽器。
  • MCP 整合:基於 Model Context Protocol 構建,可以輕鬆掛載外部工具。
  • 跨平台:適用於 Windows、MacOS 與網路瀏覽器。
  • 本地處理:UI-TARS Desktop 提供隱私且安全的本地處理。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案