LvcidPsyche/auto-browser

Give your AI agent a real browser — with a human in the loop. Open-source MCP-native browser agent.

What it solves

Auto Browser 提供了一种方式,让 AI 代理能够与真实的网页浏览器交互,同时让人类保持在循环中。它解决了脆弱的网页自动化问题,通过以下方式:

  • 允许人工实时接管活跃会话
  • 管理可重复使用的认证配置文件,使代理无需重复登录
  • 提供安全防护,如批准门槛和个人信息擦除,适用于授权工作流

How it works

系统由一个控制器 API 与一个通过 Playwright 运行 Chromium 的浏览器节点组成。它以 MCP(Model Context Protocol)服务器的形式构建,能够直接与 Claude Desktop、Cursor 等 LLM 客户端集成。支持多种模型提供商(OpenAI、Claude、Gemini,以及兼容 OpenAI 的端点如 Ollama 或 Groq)来驱动浏览器。noVNC 界面让人工操作员能够实时可视化监控或接管会话。

Who it’s for

  • 开发者:构建需要完整浏览器而非简单 HTML 抓取的 MCP 驱动代理工作流。
  • 团队:管理内部仪表盘或管理工具,需要在人为恢复时处理脆弱站点。
  • QA 工程师:执行操作员协助的浏览器调试。
  • 用户:需要使用持久、可重复使用的登录会话自动化账户工作流。

Highlights

  • MCP-native:从一开始即作为 MCP 服务器集成,实现无缝的 LLM 代理连接。
  • Human-in-the-loop:当自动化失败或需要人工干预时,可通过 noVNC 进行实时会话接管。
  • Auth Profile Management:能够保存并重用具名的认证状态,避免重复登录。
  • Safety and Compliance:内置批准门槛、操作员身份追踪、PII 擦除和策略预设(例如严格或平衡模式)。
  • Broad Model Support:通过兼容 OpenAI 的适配器,支持几乎所有前沿模型。
  • Convergence Harness:用于“Agent Skill Induction”的工具,记录并验证浏览器轨迹,以创建可重复的代理技能。