simular-ai/Agent-S
Agent S: an open agentic framework that uses computers like a human
解决的问题
Agent S 为 AI 智能体提供了一种像人类一样操作计算机图形用户界面 (GUI) 的方法。它允许智能体感知屏幕,并在各种桌面和 Web 应用程序中使用鼠标、键盘和滚动操作进行交互,从而消除了对自定义 API 集成或针对特定应用程序编写脚本的需求。
工作原理
该框架结合了主生成模型(例如 GPT-5)和专门的定位模型(例如 UI-TARS),将自然语言指令转换为可执行的 GUI 操作。它会截取屏幕截图,对其进行分析,并确定完成任务所需的点击或按键操作。它还可以配置本地编码环境,以执行 Python 和 Bash 代码来处理涉及数据处理或系统自动化的任务。
适用人群
本项目专为研究 OS 智能体的研究人员、希望自动化其桌面工作流程的开发人员以及开源计算机使用 AI 的贡献者而设计。
核心亮点
- 跨平台支持:可在 macOS、Windows 和 Linux 上运行。
- 人类水平的性能:Agent S3 是第一个在 OSWorld 基准测试中超越人类性能的计算机使用智能体 (72.60%)。
- 模型灵活性:通过 vLLM 或 Open Router 兼容来自 OpenAI、Anthropic、Gemini 和开放权重提供商的模型。
- 集成编码环境:可选功能,可在本地执行任意 Python 和 Bash 代码以处理复杂的系统任务。
相关
- 项目
- 项目
- 项目
- 项目
- 项目