vakra-dev/reader
Open source web infrastructure for AI. Scrape, crawl, and automate the web, clean markdown, browser sessions, ready for your agents.
解決する課題
Reader は、AI エージェントのウェブアクセスをシンプルにすることを目的とした、プロダクションレベルのウェブスクレイピングエンジンです。ブラウザインスタンスの管理や、Cloudflare などのアンチボット保護の回避、HTML を LLM が扱いやすい形式にクリーンアップする手間を省きます。
仕組み
Playwright 上に構築された Reader は、主に 3 つのプリミティブを提供します:URL をクリーンな Markdown に変換するスクレイピング、ページ発見のためのサイトクロール、ステルスブラウザセッションの起動です。ブラウザプーリング、TLS フィンガープリント、navigator のスプーフィング、標準・プレミアムの階層型プロキシローテーションなど、検知回避に必要な「ハードな処理」を内部で自動的に行います。
対象ユーザー
AI エージェントや LLM を活用したアプリケーションを開発しており、信頼性の高い大量のウェブデータ取得が必要だが、ボット検知や複雑なブラウザインフラの管理に悩まされたくない開発者向けです。
ハイライト
- アンチボットステルス:組み込みの TLS フィンガープリント、WebRTC マスキング、navigator スプーフィングにより検知を回避。
- LLM 対応出力:メインコンテンツを自動抽出し、ページをクリーンな Markdown または HTML に変換。ナビバー、フッター、ポップアップを除去。
- 柔軟なコントロール:シンプルなスクレイピング用のハイレベル API と、フル Playwright/Puppeteer 制御用の CDP WebSocket を返す低レベル
browser()メソッドを提供。 - インフラ管理:自動リサイクル、ヘルスモニタリング、並列処理機能を備えたブラウザプールを含む。
- ハイブリッドデプロイ:クラウド API として利用可能、またはセルフホストエンジンとしてデプロイ可能。