webbrain-one/webbrain
Open-source AI browser agent for Chrome and Firefox (monorepo) 🧠
解決する課題
WebBrainは、ウェブページを読み取り、ナビゲートし、アクションを実行できるAIエージェントを使用して、ウェブと対話する方法を提供します。ユーザーがブラウザのワークフローを自動化し、ページの内容とチャットし、定期的なウェブベースのタスクをスケジュールできるようにすることで、手動の反復作業の必要性を排除します。
仕組み
Chrome、Firefox、Edgeで利用可能なブラウザ拡張機能であり、サイドパネルにAIエージェントを統合します。壊れやすいCSSセレクターに頼るのではなく、アクセシビリティツリーを使用してページ要素を理解します。ユーザーは、ローカルサーバー(llama.cppまたはOllama経由)、クラウドAPI(OpenAI、Anthropicなど)、または管理されたデフォルトのプロバイダーを含む、さまざまなLLMに接続できます。エージェントは3つのモードで動作します:読み取り専用のクエリ用の「Ask」、クリックやタイピングなどのアクションを実行するための「Act」、および技術的なページ診断用の「Dev」です。
対象ユーザー
WebBrainは、ウェブベースのワークフローを自動化したいユーザー、複数のページから情報を抽出する必要がある研究者、およびウェブアプリケーションのナビゲーションや操作を支援するAI搭載アシスタントを求める開発者向けに設計されています。
ハイライト
- 柔軟なモデルサポート: 100以上のクラウドプロバイダーおよびローカルLLMサーバーと互換性があります。
- 自律的なツール使用: 複雑なタスクを完了するために、多段階のループ(最大195ステップ)を実行できます。
- 保存されたワークフロー: 成功したエージェントの実行を、再利用可能で共有可能なワークフローに変換できます。
- スケジュールされたタスク:
/scheduleおよび/watchコマンドをサポートし、ページをポーリングして特定の条件が満たされたときにアクションを実行します。 - スマートなコンテキスト管理: モデルのコンテキスト制限内で長い会話を処理するための、トークンを認識した自動圧縮機能を備えています。