bytedance/UI-TARS-desktop
The Open-Source Multimodal AI Agent Stack: Connecting Cutting-Edge AI Models and Agent Infra
解决的问题
它实现了使用自然语言指令来控制计算机和浏览器。通过将用户界面 (GUI) 视为视觉输入,它允许 AI 智能体执行复杂的任务——例如预订航班、调整软件设置或检查 GitHub issues——而无需为每个应用程序进行手动 API 集成。
工作原理
该项目由两个主要部分组成:
- Agent TARS: 一个将视觉语言模型 (VLMs) 与 CLI 和 Web UI 集成的多模态 AI 智能体技术栈。它使用混合策略,通过视觉接地 (visual grounding)、DOM 分析或两者的结合来控制浏览器。它还与 Model Context Protocol (MCP) 服务器集成,以连接到现实世界的工具。
- UI-TARS Desktop: 一个原生应用程序,使用 UI-TARS 模型(以及 Seed-1.5-VL/1.6 系列)根据屏幕截图和视觉识别提供精确的鼠标和键盘控制。
适用对象
- 希望使用提供的 SDK 构建 GUI 自动化智能体的开发人员。
- 希望使用自然语言自动执行重复性的桌面或浏览器任务的用户。
- 对多模态智能体和用于 GUI 交互的视觉接地感兴趣的研究人员。
亮点
- 混合浏览器控制:支持基于 GUI 的视觉接地和基于 DOM 的交互。
- 远程操作:能够远程控制计算机和浏览器。
- MCP 集成:基于 Model Context Protocol 构建,可以轻松挂载外部工具。
- 跨平台:适用于 Windows、MacOS 和网络浏览器。
- 本地处理:UI-TARS Desktop 提供私密且安全的本地处理。
相关
- 项目
- 项目
- 项目
- 项目
- 项目