vakra-dev/reader
Open source web infrastructure for AI. Scrape, crawl, and automate the web, clean markdown, browser sessions, ready for your agents.
它解决了什么
Reader 是一个生产级别的网页爬取引擎,旨在简化 AI 代理的网页访问。它消除管理浏览器实例的复杂性、绕过反机器人防护(如 Cloudflare),并将 HTML 清理成适合 LLM 使用的格式。
它如何工作
Reader 基于 Playwright,提供三种主要原语:将 URL 抓取为干净的 Markdown、爬行网站以发现页面、以及启动隐蔽的浏览器会话。它在底层处理“硬核”工作,包括浏览器池、TLS 指纹、navigator 伪装,以及分层代理轮换(标准和高级)以避免被检测。
适用对象
开发 AI 代理或以 LLM 为核心的应用程序的开发者,这些应用需要可靠且高流量的网页数据提取,却不想与机器人检测或复杂的浏览器基础设施斗争。
亮点
- 反机器人隐蔽:内置 TLS 指纹、WebRTC 掩蔽和 navigator 伪装,绕过检测。
- LLM‑Ready 输出:自动抽取主要内容,将页面转换为干净的 Markdown 或 HTML,去除导航栏、页脚和弹窗。
- 灵活控制:提供高级 API 进行简单抓取,也提供低级
browser()方法,返回 CDP WebSocket 以完整控制 Playwright/Puppeteer。 - 基础设施管理:包含自动回收的浏览器池、健康监控与并发处理能力。
- 混合部署:可作为云 API 使用,也可自行部署为本地引擎。