bytedance/UI-TARS-desktop

The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra

解决的问题

它实现了使用自然语言指令来控制计算机和浏览器。通过将用户界面 (GUI) 视为视觉输入,它允许 AI 智能体执行复杂的任务——例如预订航班、调整软件设置或检查 GitHub issues——而无需为每个应用程序进行手动 API 集成。

工作原理

该项目由两个主要部分组成:

  1. Agent TARS: 一个将视觉语言模型 (VLMs) 与 CLI 和 Web UI 集成的多模态 AI 智能体技术栈。它使用混合策略,通过视觉接地 (visual grounding)、DOM 分析或两者的结合来控制浏览器。它还与 Model Context Protocol (MCP) 服务器集成,以连接到现实世界的工具。
  2. UI-TARS Desktop: 一个原生应用程序,使用 UI-TARS 模型(以及 Seed-1.5-VL/1.6 系列)根据屏幕截图和视觉识别提供精确的鼠标和键盘控制。

适用对象

  • 希望使用提供的 SDK 构建 GUI 自动化智能体的开发人员。
  • 希望使用自然语言自动执行重复性的桌面或浏览器任务的用户。
  • 对多模态智能体和用于 GUI 交互的视觉接地感兴趣的研究人员。

亮点

  • 混合浏览器控制:支持基于 GUI 的视觉接地和基于 DOM 的交互。
  • 远程操作:能够远程控制计算机和浏览器。
  • MCP 集成:基于 Model Context Protocol 构建,可以轻松挂载外部工具。
  • 跨平台:适用于 Windows、MacOS 和网络浏览器。
  • 本地处理:UI-TARS Desktop 提供私密且安全的本地处理。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目