jmerelnyc/Photo-agents

Autonomous self-evolving agents. Vision-grounded layered memory and self-written skills for LLM agents that operate your computer.

解決する課題

Photo Agentsは、コンピュータ画面上で知覚、推論、実行ができる自律型エージェントのためのフレームワークを提供します。長いチャットの履歴を、生物学的に着想を得たメモリシステムとビジョンベースのグラウンディングに置き換えることを目指しており、エージェントが人間のユーザーと同様にコンピュータを操作できるようにします。

仕組み

このシステムは、ストリーミングエージェントループを使用しており、画面の知覚、状態の推論、アクションの実行というサイクルを通じてツール呼び出しLLMを駆動します。Anthropic ClaudeやOpenAI GPTをサポートするマルチプロバイダーLLMルーターを搭載しています。コンピュータと対話するために、ファイルI/O、サンドボックス化されたコード実行(Python, PowerShell, bash)、およびChrome DevTools Protocolブリッジを介したブラウザ自動化を含む物理実行ツールセットを採用しています。また、階層型メモリシステム(working, global, SOP, およびsession archive)と、エージェントが成功した結果から自身のスキルを書き込むことができる自己進化メカニズムを実装しています。

対象ユーザー

Webアプリ、デスクトップアプリ、および様々なチャットプラットフォーム(Telegram, QQ, Feishuなど)を含む様々なインターフェースにわたって、コンピュータタスクを自動化するために、自律的なビジョン基盤のエージェントをローカルで実行したいユーザー。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト