vakra-dev/reader
Open source web infrastructure for AI. Scrape, crawl, and automate the web, clean markdown, browser sessions, ready for your agents.
它解決了什麼
Reader 是一個生產等級的網頁爬蟲引擎,旨在簡化 AI 代理的網頁存取。它消除管理瀏覽器實例的複雜性、繞過反機器人防護(如 Cloudflare),並將 HTML 清理成適合 LLM 使用的格式。
它如何運作
Reader 基於 Playwright,提供三個主要原語:將 URL 抓取為乾淨的 Markdown、爬行網站以發現頁面、以及啟動隱蔽的瀏覽器會話。它在底層處理「硬核」工作,包括瀏覽器池、TLS 指紋、navigator 偽裝,以及分層代理輪換(標準與高級)以避免被偵測。
適用對象
開發 AI 代理或以 LLM 為核心的應用程式的開發者,這些應用需要可靠且高流量的網頁資料擷取,卻不想與機器人偵測或複雜的瀏覽器基礎設施鬥爭。
重點特色
- 反機器人隱蔽:內建 TLS 指紋、WebRTC 掩蔽與 navigator 偽裝,繞過偵測。
- LLM‑Ready 輸出:自動抽取主要內容,將頁面轉換為乾淨的 Markdown 或 HTML,去除導覽列、頁腳與彈出視窗。
- 彈性控制:提供高階 API 進行簡易抓取,也提供低階
browser()方法,回傳 CDP WebSocket 以完整控制 Playwright/Puppeteer。 - 基礎設施管理:內建自動回收的瀏覽器池、健康監控與並行處理能力。
- 混合部署:可作為雲端 API 使用,也可自行部署為本地引擎。