jmerelnyc/Photo-agents

Autonomous self-evolving agents. Vision-grounded layered memory and self-written skills for LLM agents that operate your computer.

解決的問題

Photo Agents 為能夠在電腦螢幕上進行感知、推理和執行的自主代理提供了一個框架。它旨在利用受生物啟發的記憶系統和基於視覺的落地 (grounding) 來取代冗長的對話紀錄,使代理能夠像人類使用者一樣操作電腦。

工作原理

該系統使用串流代理循環,透過感知螢幕、推理狀態和採取行動的循環來驅動工具調用型 LLM。它具有支援 Anthropic Claude 和 OpenAI GPT 的多供應商 LLM 路由器。為了與電腦互動,它採用了實體執行工具集,包括檔案 I/O、沙盒程式碼執行 (Python, PowerShell, bash) 以及透過 Chrome DevTools Protocol 橋接的瀏覽器自動化。它還實現了一個分層記憶系統 (working, global, SOP 和 session archive) 以及一種自我進化機制,代理可以根據成功的結果編寫自己的技能。

適用對象

希望在本地執行自主、以視覺為基礎的代理,以實現跨各種介面(包括 Web 應用程式、桌面應用程式和各種聊天平台 (Telegram, QQ, Feishu 等))的電腦任務自動化的使用者。

亮點

  • 以視覺為基礎的行動:基於它在螢幕上看到的內容而非僅僅是文本紀錄進行操作。
  • 多前端支援:包括精美的 Streamlit Web 應用程式、PyQt 桌面應用程式和多種聊天機器人整合。
  • 多 LLM 路由器:原生支援 Claude 和 GPT,並帶有故障轉移會話 mixin。
  • 自我進化技能:代理可以根據實際的成功情況建立並編寫自己的技能和 SOP。
  • 本地執行:在本地執行以確保螢幕數據和金鑰的所有權。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案