unclecode/crawl4ai

🚀🤖 Crawl4AI: Open-source LLM Friendly Web Crawler & Scraper. Don't be shy, join here: https://discord.gg/jP8KfhDhyN

解决的问题

Crawl4AI 是一个专为准备大语言模型(LLMs)所需网页内容而设计的开源网络爬虫和网页抓取工具。它解决了网页数据杂乱无章、结构不清晰的问题,将网页转换为适合 RAG(检索增强生成)、AI 代理和数据流水线的干净、结构化 Markdown。

工作原理

该工具使用异步浏览器池(通过 Playwright)获取网页,并应用多种处理策略:

  • Markdown 生成:使用基于启发式的过滤(如 BM25 算法)去除噪声,生成聚焦核心信息的「适配 Markdown」。
  • 结构化提取:支持基于 LLM 的复杂数据提取,也支持基于 CSS/XPath 的快速、结构化 JSON 输出。
  • 浏览器控制:管理浏览器会话、代理和 Cookie,并可执行自定义 JavaScript 以处理动态内容或无限滚动。
  • 部署方式:可作为 Python 库、CLI 工具,或以 Docker 化的 FastAPI 服务器形式运行,附带监控仪表板。

适用人群

  • AI 开发者:构建 RAG 系统或 AI 代理,需要高质量、干净的网页数据作为输入。
  • 数据工程师:需要一种可扩展、可控的方式从网页中提取结构化数据,且不被反爬虫机制拦截。
  • LLM 应用构建者:希望将网页转换为机器可读格式,而无需支付专有爬虫 API 的费用。

核心亮点

  • LLM 就绪输出:生成包含标题、表格和引用提示的结构化 Markdown。
  • 隐身模式:模拟真实用户行为,避免被识别为机器人。
  • 自适应智能:学习网站模式,仅探索相关内容。
  • 深度爬取:支持 BFS 策略,具备崩溃恢复和预取模式,实现更快发现。
  • 灵活提取:结合 LLM 驱动的语义提取与快速 CSS 基础的模式提取。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目