browser-act/skills

Browser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.

解決的問題

BrowserAct 提供專為 AI 代理設計的瀏覽器環境,用於執行網頁自動化、資料擷取與帳號導向的工作流程。它解決了 AI 代理被反機器人措施阻擋、無法在平行任務間處理驗證會話,以及處理原始 HTML/JSON 供 LLM 推理效率低下的問題。

工作原理

此專案提供一組 AI 代理可透過 shell 命令載入與執行的「技能」。透過三層防護機制來繞過封鎖:環境層(偽造指紋、TLS 輪換)、執行層(CAPTCHA 解決)、人類層(遠端手動接管以進行人工干預)。

提供三種瀏覽器模式:

  • Chrome:重用本地登入狀態。
  • Stealth Privacy:為批量爬取提供全新指紋與代理。
  • Stealth Fixed Identity:為維持帳號身分提供穩定指紋與 IP。

為優化 LLM,採用緊湊的索引文字格式表示頁面狀態,而非原始 DOM,讓代理可透過索引與元素互動(例如:click 3)。

適用對象

使用 Claude Code、Cursor 或 Gemini CLI 等工具開發 AI 代理的開發者,需要其代理與真實網路互動、管理多個帳號,或在不被偵測為機器人的情況下爬取受保護內容。

核心亮點

  • 代理導向設計:使用索引互動與緊湊文字輸出,減少 token 使用並簡化推理。
  • 反封鎖套件:整合隱身指紋、TLS 輪換、住宅代理與自動 CAPTCHA 解決。
  • 人機協同:包含 remote-assist 功能,當代理卡住時,人類可透過即時 URL 接管瀏覽器會話。
  • 零干擾並行:支援獨立的 Cookie 與指紋,實現平行任務間無交叉污染。
  • Skill Forge:自動發現網站 API 與資料模式,無需手動編碼即可生成可重複使用的爬取技能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案