ScrapeGraphAI/Scrapegraph-ai

Python scraper based on AI

What it solves

ScrapeGraphAI 是一個 Python 函式庫,旨在透過移除撰寫複雜、手動爬蟲邏輯的需求,簡化網頁爬取。使用者不必手動定義 selector 或規則,只要以自然語言提示描述想要從網站或本機文件(XML、HTML、JSON、Markdown)中抽取的資訊即可。

How it works

此函式庫結合大型語言模型(LLM)與直接的圖形邏輯來建立爬取管線。它可整合多種 LLM 供應商,包括 OpenAI、Groq、Azure、Gemini、MiniMax,或透過 Ollama 使用本機模型。要抽取資料時,使用者提供提示與來源 URL 或檔案,函式庫會負責內容抓取(使用 Playwright)以及 LLM 驅動的抽取流程。

Who it’s for

需要從網路或本機檔案中抽取結構化資料,且不想承擔傳統爬蟲工具維護負擔的開發者與資料科學家。它亦可與 Langchain、Llama Index、Crew.ai 等代理框架整合。

Highlights

  • Prompt-based extraction:使用自然語言而非 CSS selector 進行資料抽取。
  • Multiple pipeline types:提供單頁爬取 (SmartScraperGraph)、多頁爬取 (SmartScraperMultiGraph)、搜尋引擎爬取 (SearchGraph)、以及產生 Python 程式碼或音訊檔案 (ScriptCreatorGraphSpeechGraph) 的專屬圖形。
  • Flexible LLM support:同時支援雲端 API 與透過 Ollama 的本機 LLM。
  • Broad integration ecosystem:可與低程式碼工具(Zapier、n8n、Bubble)及代理框架(Langchain、Llama Index)協同運作。