yeahhe365/Gemini-Nexus

Gemini Nexus 是一款面向浏览器场景的 AI 助手扩展,集成 Gemini Web、Gemini API 与 OpenAI 兼容接口,支持网页上下文、图像处理、工具调用和 MCP 浏览器控制。

何を解決するか

Gemini Nexusは、複数のAIプロバイダーを単一のブラウザインターフェースに統合するChrome拡張機能です。AI支援によるブラウジングのための統一されたサイドパネルとフローティングツールバーを提供することで、異なるAIウェブタブの切り替えや、異なるプラットフォーム間での複数のAPIキーの管理の必要性を排除します。

仕組み

この拡張機能は、ブラウザのネイティブAIレイヤーとして機能し、さまざまな接続方法をサポートしています:

  • プロバイダー統合: Gemini Web(リバースエンジニアリングされたRPCエンドポイント経由)、公式のGemini API、OpenAI互換API(DeepSeek、OpenRouter、Qwenを含む)、Anthropic、およびZhipuに接続します。
  • ブラウザ制御: Chrome DevTools Protocolを使用し、AIがクリック、タイピング、ページ遷移、ページ内容のスナップショット作成などのエージェント的なタスクを実行できるようにします。
  • 外部ツール連携: SSE、WebSocket、またはHTTPを介してModel Context Protocol (MCP) をサポートし、ローカルプロキシを通じて外部MCPサーバーのツールにAIがアクセスできるようにします。
  • UI統合: テキスト選択アクション(翻訳、要約)のためのフローティングツールバーと、フル会話のためのサイドパネルを注入します。

対象ユーザー

  • ブラウジング中に複数のLLMにアクセスするための単一のインターフェースを求めるユーザー。
  • AIエージェントを使用してブラウザタスクを自動化したい開発者やパワーユーザー。
  • 外部MCPツールをブラウザのワークフローに直接統合したいと考えている人々。

ハイライト

  • マルチプロバイダーサポート: Gemini Web、公式API、およびさまざまなサードパーティプロバイダーをシームレスに切り替えます。
  • エージェント的なブラウザ制御: フォーム入力やタブ管理などの実際のブラウザ操作を実行する能力。
  • MCP統合: 外部MCPサーバーに接続してAIの機能を拡張します。
  • 高度な入力: 画像ベースのプロンプトのために、OCR、スクリーンショット翻訳、および画面/ウィンドウキャプチャをサポートします。
  • コンテキスト管理: 長い会話を処理するために、要約圧縮と最近のタームのトリミングを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト