any4ai/AnyCrawl
AnyCrawl 🚀: A Node.js/TypeScript crawler that turns websites into LLM-ready data and extracts structured SERP results from Google/Bing/Baidu/etc. Native multi-threading for bulk processing.
What it solves
AnyCrawl 提供高性能的工具包用于收集网络数据,解决了扩展网页抓取、全站爬取以及搜索引擎结果(SERP)获取的难题。它专门针对“LLM‑ready”数据的需求,通过 AI 从非结构化网页中抽取结构化的 JSON 数据。
How it works
AnyCrawl 作为一个抓取和爬取服务,支持多种渲染引擎——cheerio 用于快速的静态 HTML 解析,playwright 或 puppeteer 用于处理大量 JavaScript 的页面。它提供三种主要的运行模式:
- Web Scraping:从单个页面提取内容。
- Site Crawling:根据深度和域名限制遍历整个网站。
- SERP Crawling:从 Google 等搜索引擎获取搜索结果。
为了提供结构化数据,它会与 LLM 提供商(如 Atlas Cloud)集成,将页面内容解析为用户自定义的 JSON schema。
Who it’s for
此工具面向构建 AI 代理、数据收集流水线以及任何需要可扩展、结构化网页数据供 LLM 使用的应用程序的开发者。
Highlights
- AI-Powered Extraction:使用 LLM 将原始网页依据提供的 schema 转换为结构化 JSON。
- Flexible Rendering:支持静态解析和完整浏览器渲染,以处理动态内容。
- Scalable Architecture:利用多线程和多进程高效处理批量任务。
- Search Integration:内置对多引擎 SERP 爬取的支持。
- Proxy Support:提供默认代理,并允许自定义代理配置以绕过反爬虫措施。