jmerelnyc/Photo-agents
Autonomous self-evolving agents. Vision-grounded layered memory and self-written skills for LLM agents that operate your computer.
해결하는 문제
Photo Agents는 컴퓨터 화면에서 지각, 추론 및 실행을 수행할 수 있는 자율 에이전트를 위한 프레임워크를 제공합니다. 긴 채팅 기록을 생물학적 영감을 받은 메모리 시스템과 비전 기반 그라운딩으로 대체하여, 에이전트가 인간 사용자와 유사하게 컴퓨터를 조작할 수 있도록 하는 것을 목표로 합니다.
작동 방식
이 시스템은 스트리밍 에이전트 루프를 사용하여 화면 지각, 상태 추론, 작업 수행의 사이클을 통해 도구 호출 LLM을 구동합니다. Anthropic Claude 및 OpenAI GPT를 지원하는 멀티 프로바이더 LLM 라우터를 특징으로 합니다. 컴퓨터와 상호 작용하기 위해 파일 I/O, 샌드박스 코드 실행(Python, PowerShell, bash) 및 Chrome DevTools Protocol 브리지를 통한 브라우저 자동화를 포함하는 물리적 실행 툴셋을 채택합니다. 또한 계층형 메모리 시스템(working, global, SOP 및 session archive)과 에이전트가 성공적인 결과로부터 자신의 기술을 작성할 수 있는 자기 진화 메커니즘을 구현합니다.
대상 사용자
웹 앱, 데스크톱 애플리케이션 및 다양한 채팅 플랫폼(Telegram, QQ, Feishu 등)을 포함한 다양한 인터페이스에서 컴퓨터 작업을 자동화하기 위해 자율적인 비전 기반 에이전트를 로컬에서 실행하고자 하는 사용자.
주요 특징
- 비전 기반 작업: 단순한 텍스트 기록이 아닌 화면에 보이는 내용을 기반으로 작동합니다.
- 멀티 프론트엔드 지원: 세련된 Streamlit 웹 앱, PyQt 데스크톱 앱 및 다양한 챗봇 통합을 포함합니다.
- 멀티 LLM 라우터: Claude 및 GPT에 대한 네이티브 지원과 페일오버 세션 mixin을 제공합니다.
- 자기 진화 기술: 에이전트는 실제 성공을 바탕으로 자신의 기술과 SOP를 생성하고 작성할 수 있습니다.
- 로컬 실행: 화면 데이터와 키의 소유권을 보장하기 위해 로컬에서 실행됩니다。
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트