any4ai/AnyCrawl

AnyCrawl 🚀: A Node.js/TypeScript crawler that turns websites into LLM-ready data and extracts structured SERP results from Google/Bing/Baidu/etc. Native multi-threading for bulk processing.

What it solves

AnyCrawl 提供高效能的工具組來收集網路資料,解決了擴展網頁擷取、全站爬蟲以及搜尋引擎結果(SERP)取得的困難。它特別針對「LLM‑ready」資料的需求,透過 AI 從非結構化的網頁抽取結構化的 JSON 資料。

How it works

AnyCrawl 作為一個擷取與爬蟲服務,支援多種渲染引擎——cheerio 用於快速的靜態 HTML 解析,playwrightpuppeteer 用於處理大量 JavaScript 的頁面。它提供三種主要的運作模式:

  • Web Scraping:從單一頁面抽取內容。
  • Site Crawling:依照深度與網域限制遍歷整個網站。
  • SERP Crawling:從 Google 等搜尋引擎取得搜尋結果。

為了提供結構化資料,它會與 LLM 供應商(如 Atlas Cloud)整合,將頁面內容解析成使用者自訂的 JSON schema。

Who it’s for

此工具適合開發 AI 代理人、資料收集管線,以及任何需要可擴展、結構化網路資料供 LLM 使用的應用程式。

Highlights

  • AI-Powered Extraction:使用 LLM 將原始網頁依照提供的 schema 轉換為結構化 JSON。
  • Flexible Rendering:支援靜態解析與完整瀏覽器渲染,以處理動態內容。
  • Scalable Architecture:利用多執行緒與多程序處理批次任務,提升效率。
  • Search Integration:內建多引擎 SERP 爬取支援。
  • Proxy Support:提供預設代理,並允許自訂代理設定以繞過防機器人機制。