browser-act/skills
Browser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.
解决的问题
BrowserAct 为 AI 代理提供了一个专为网页自动化、数据提取和基于账户的工作流设计的浏览器环境。它解决了 AI 代理被反机器人措施拦截、无法在并行任务间处理认证会话,以及对原始 HTML/JSON 进行处理以供 LLM 推理效率低下的问题。
工作原理
该项目提供了一组 AI 代理可通过 shell 命令加载和执行的「技能」。通过三层防护机制绕过封锁:环境层(指纹伪造、TLS 轮换)、执行层(CAPTCHA 求解)、人类层(远程手把手接管以进行人工干预)。
提供三种浏览器模式:
- Chrome:复用本地登录状态。
- Stealth Privacy:为批量爬取提供全新指纹和代理。
- Stealth Fixed Identity:为维持账户身份提供稳定指纹和 IP。
为优化 LLM,采用紧凑的索引文本格式表示页面状态,而非原始 DOM,使代理可通过索引与元素交互(例如:click 3)。
适用人群
使用 Claude Code、Cursor 或 Gemini CLI 等工具构建 AI 代理的开发者,需要其代理与真实网络交互、管理多个账户,或在不被检测为机器人的情况下爬取受保护内容。
核心亮点
- 代理优先设计:使用索引交互和紧凑文本输出,减少 token 使用并简化推理。
- 反封锁套件:整合隐身指纹、TLS 轮换、住宅代理和自动 CAPTCHA 求解。
- 人机协同:包含
remote-assist功能,当代理卡住时,人类可通过实时 URL 接管浏览器会话。 - 零干扰并发:支持独立的 Cookie 和指纹,实现并行任务间无交叉污染。
- Skill Forge:自动发现网站 API 和数据模式,无需手动编码即可生成可复用的爬取技能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目