any4ai/AnyCrawl
AnyCrawl 🚀: A Node.js/TypeScript crawler that turns websites into LLM-ready data and extracts structured SERP results from Google/Bing/Baidu/etc. Native multi-threading for bulk processing.
What it solves
AnyCrawl はウェブデータ収集のための高性能ツールキットを提供し、ウェブスクレイピング、サイト全体のクローリング、検索エンジン結果(SERP)取得のスケーリングの難しさを解決します。特に AI を用いて非構造化ページから構造化 JSON データを抽出し、"LLM‑ready" データを実現します。
How it works
AnyCrawl はスクレイピング・クローリングサービスとして動作し、複数のレンダリングエンジンをサポートします—高速な静的 HTML 解析には cheerio、JavaScript が多いページには playwright または puppeteer を使用します。主な動作モードは次の 3 つです:
- Web Scraping:単一ページからコンテンツを抽出。
- Site Crawling:深さとドメイン制限に基づきサイト全体を巡回。
- SERP Crawling:Google などの検索エンジンから検索結果を取得。
構造化データを提供するために、LLM プロバイダー(例:Atlas Cloud)と連携し、ページ内容をユーザー定義の JSON スキーマに変換します。
Who it’s for
AI エージェント、データ収集パイプライン、LLM が利用できるスケーラブルで構造化されたウェブデータを必要とするあらゆるアプリケーションの開発者向けに設計されています。
Highlights
- AI-Powered Extraction:提供されたスキーマに基づき、LLM を使用して生のウェブページを構造化 JSON に変換。
- Flexible Rendering:静的解析とフルブラウザレンダリングの両方をサポートし、動的コンテンツに対応。
- Scalable Architecture:マルチスレッド・マルチプロセスを活用し、バッチタスクを効率的に処理。
- Search Integration:複数エンジンに対応した SERP クローリングを標準装備。
- Proxy Support:デフォルトプロキシを提供し、カスタムプロキシ設定でアンチボット対策を回避可能。