simular-ai/Agent-S
Agent S: an open agentic framework that uses computers like a human
解決的問題
Agent S 提供了一種方法,讓 AI 代理能像人類一樣操作電腦的圖形使用者介面 (GUI)。它允許代理感知螢幕,並在各種桌面和網頁應用程式中使用滑鼠、鍵盤和捲動動作進行互動,從而消除了對自訂 API 整合或個別應用程式腳本的需求。
運作方式
該框架結合了主生成模型(例如 GPT-5)和專用的基礎定位模型(例如 UI-TARS),將自然語言指令轉換為可執行的 GUI 動作。它會擷取螢幕截圖、進行分析,並決定完成任務所需的點擊或按鍵操作。它也可以設定本地編碼環境,以執行 Python 和 Bash 程式碼來處理涉及資料處理或系統自動化的任務。
適用對象
本專案專為研究 OS 代理的研究人員、希望自動化其桌面工作流程的開發人員,以及開源電腦使用 AI 的貢獻者所設計。
重點特色
- 跨平台支援:可在 macOS、Windows 和 Linux 上運作。
- 人類水準的效能:Agent S3 是第一個在 OSWorld 基準測試中超越人類效能的電腦使用代理 (72.60%)。
- 模型靈活性:透過 vLLM 或 Open Router 相容於來自 OpenAI、Anthropic、Gemini 和開放權重供應商的模型。
- 整合編碼環境:可選功能,可在本地執行任意 Python 和 Bash 程式碼以處理複雜的系統任務。
相關
- 專案
- 專案
- 專案
- 專案
- 專案