ScrapeGraphAI/Scrapegraph-ai

Python scraper based on AI

What it solves

ScrapeGraphAI 是一个 Python 库,旨在通过去除编写复杂、手动爬取逻辑的需求,简化网页抓取。用户无需手动定义 selector 或规则,只需使用自然语言提示描述想要从网站或本地文档(XML、HTML、JSON、Markdown)中提取的信息。

How it works

该库结合大型语言模型(LLM)和直接的图逻辑来创建抓取管道。它可以集成多种 LLM 提供商,包括 OpenAI、Groq、Azure、Gemini、MiniMax,或通过 Ollama 使用本地模型。要提取数据时,用户提供提示和来源 URL 或文件,库会处理内容获取(使用 Playwright)以及 LLM 驱动的提取过程。

Who it’s for

需要从网络或本地文件中提取结构化数据且不想承担传统抓取工具维护负担的开发者和数据科学家。它也可与 Langchain、Llama Index、Crew.ai 等代理框架集成。

Highlights

  • Prompt-based extraction:使用自然语言而非 CSS selector 进行数据提取。
  • Multiple pipeline types:包括单页抓取 (SmartScraperGraph)、多页抓取 (SmartScraperMultiGraph)、搜索引擎抓取 (SearchGraph)、以及生成 Python 脚本或音频文件 (ScriptCreatorGraphSpeechGraph) 的专用图。
  • Flexible LLM support:兼容云端 API 与通过 Ollama 的本地 LLM。
  • Broad integration ecosystem:可与低代码工具(Zapier、n8n、Bubble)及代理框架(Langchain、Llama Index)协同工作。