any4ai/AnyCrawl

AnyCrawl 🚀: A Node.js/TypeScript crawler that turns websites into LLM-ready data and extracts structured SERP results from Google/Bing/Baidu/etc. Native multi-threading for bulk processing.

What it solves

AnyCrawl はウェブデータ収集のための高性能ツールキットを提供し、ウェブスクレイピング、サイト全体のクローリング、検索エンジン結果(SERP)取得のスケーリングの難しさを解決します。特に AI を用いて非構造化ページから構造化 JSON データを抽出し、"LLM‑ready" データを実現します。

How it works

AnyCrawl はスクレイピング・クローリングサービスとして動作し、複数のレンダリングエンジンをサポートします—高速な静的 HTML 解析には cheerio、JavaScript が多いページには playwright または puppeteer を使用します。主な動作モードは次の 3 つです:

  • Web Scraping:単一ページからコンテンツを抽出。
  • Site Crawling:深さとドメイン制限に基づきサイト全体を巡回。
  • SERP Crawling:Google などの検索エンジンから検索結果を取得。

構造化データを提供するために、LLM プロバイダー(例:Atlas Cloud)と連携し、ページ内容をユーザー定義の JSON スキーマに変換します。

Who it’s for

AI エージェント、データ収集パイプライン、LLM が利用できるスケーラブルで構造化されたウェブデータを必要とするあらゆるアプリケーションの開発者向けに設計されています。

Highlights

  • AI-Powered Extraction:提供されたスキーマに基づき、LLM を使用して生のウェブページを構造化 JSON に変換。
  • Flexible Rendering:静的解析とフルブラウザレンダリングの両方をサポートし、動的コンテンツに対応。
  • Scalable Architecture:マルチスレッド・マルチプロセスを活用し、バッチタスクを効率的に処理。
  • Search Integration:複数エンジンに対応した SERP クローリングを標準装備。
  • Proxy Support:デフォルトプロキシを提供し、カスタムプロキシ設定でアンチボット対策を回避可能。