ScrapeGraphAI/Scrapegraph-ai
Python scraper based on AI
What it solves
ScrapeGraphAI 是一個 Python 函式庫,旨在透過移除撰寫複雜、手動爬蟲邏輯的需求,簡化網頁爬取。使用者不必手動定義 selector 或規則,只要以自然語言提示描述想要從網站或本機文件(XML、HTML、JSON、Markdown)中抽取的資訊即可。
How it works
此函式庫結合大型語言模型(LLM)與直接的圖形邏輯來建立爬取管線。它可整合多種 LLM 供應商,包括 OpenAI、Groq、Azure、Gemini、MiniMax,或透過 Ollama 使用本機模型。要抽取資料時,使用者提供提示與來源 URL 或檔案,函式庫會負責內容抓取(使用 Playwright)以及 LLM 驅動的抽取流程。
Who it’s for
需要從網路或本機檔案中抽取結構化資料,且不想承擔傳統爬蟲工具維護負擔的開發者與資料科學家。它亦可與 Langchain、Llama Index、Crew.ai 等代理框架整合。
Highlights
- Prompt-based extraction:使用自然語言而非 CSS selector 進行資料抽取。
- Multiple pipeline types:提供單頁爬取 (
SmartScraperGraph)、多頁爬取 (SmartScraperMultiGraph)、搜尋引擎爬取 (SearchGraph)、以及產生 Python 程式碼或音訊檔案 (ScriptCreatorGraph、SpeechGraph) 的專屬圖形。 - Flexible LLM support:同時支援雲端 API 與透過 Ollama 的本機 LLM。
- Broad integration ecosystem:可與低程式碼工具(Zapier、n8n、Bubble)及代理框架(Langchain、Llama Index)協同運作。