any4ai/AnyCrawl

AnyCrawl 🚀: A Node.js/TypeScript crawler that turns websites into LLM-ready data and extracts structured SERP results from Google/Bing/Baidu/etc. Native multi-threading for bulk processing.

What it solves

AnyCrawl 提供高性能的工具包用于收集网络数据,解决了扩展网页抓取、全站爬取以及搜索引擎结果(SERP)获取的难题。它专门针对“LLM‑ready”数据的需求,通过 AI 从非结构化网页中抽取结构化的 JSON 数据。

How it works

AnyCrawl 作为一个抓取和爬取服务,支持多种渲染引擎——cheerio 用于快速的静态 HTML 解析,playwrightpuppeteer 用于处理大量 JavaScript 的页面。它提供三种主要的运行模式:

  • Web Scraping:从单个页面提取内容。
  • Site Crawling:根据深度和域名限制遍历整个网站。
  • SERP Crawling:从 Google 等搜索引擎获取搜索结果。

为了提供结构化数据,它会与 LLM 提供商(如 Atlas Cloud)集成,将页面内容解析为用户自定义的 JSON schema。

Who it’s for

此工具面向构建 AI 代理、数据收集流水线以及任何需要可扩展、结构化网页数据供 LLM 使用的应用程序的开发者。

Highlights

  • AI-Powered Extraction:使用 LLM 将原始网页依据提供的 schema 转换为结构化 JSON。
  • Flexible Rendering:支持静态解析和完整浏览器渲染,以处理动态内容。
  • Scalable Architecture:利用多线程和多进程高效处理批量任务。
  • Search Integration:内置对多引擎 SERP 爬取的支持。
  • Proxy Support:提供默认代理,并允许自定义代理配置以绕过反爬虫措施。