jmerelnyc/Photo-agents
Autonomous self-evolving agents. Vision-grounded layered memory and self-written skills for LLM agents that operate your computer.
解决的问题
Photo Agents 为能够在计算机屏幕上进行感知、推理和执行的自主智能体提供了一个框架。它旨在利用受生物启发的记忆系统和基于视觉的落地(grounding)来取代冗长的聊天记录,使智能体能够像人类用户一样操作计算机。
工作原理
该系统使用流式智能体循环,通过感知屏幕、推理状态和采取行动的循环来驱动工具调用型 LLM。它具有支持 Anthropic Claude 和 OpenAI GPT 的多供应商 LLM 路由器。为了与计算机交互,它采用了物理执行工具集,包括文件 I/O、沙箱代码执行(Python, PowerShell, bash)以及通过 Chrome DevTools Protocol 桥接的浏览器自动化。它还实现了一个分层记忆系统(working, global, SOP 和 session archive)以及一种自我进化机制,智能体可以根据成功的成果编写自己的技能。
适用对象
希望在本地运行自主、基于视觉的智能体,以实现跨各种界面(包括 Web 应用、桌面应用和各种聊天平台(Telegram, QQ, Feishu 等))的计算机任务自动化的用户。
亮点
- 基于视觉的行动:基于它在屏幕上看到的内容而非仅仅是文本记录进行操作。
- 多前端支持:包括精美的 Streamlit Web 应用、PyQt 桌面应用和多种聊天机器人集成。
- 多 LLM 路由器:原生支持 Claude 和 GPT,并带有故障转移会话 mixin。
- 自我进化技能:智能体可以根据实际的成功情况创建并编写自己的技能和 SOP。
- 本地执行:在本地运行以确保屏幕数据和密钥的所有权。
相关
- 项目
- 项目
- 项目
- 项目
- 项目