ScrapeGraphAI/Scrapegraph-ai

Python scraper based on AI

What it solves

ScrapeGraphAI は、複雑で手動のスクレイピングロジックを書く必要をなくすことで、ウェブスクレイピングをシンプルにすることを目的とした Python ライブラリです。ユーザーはセレクタやルールを手動で定義する代わりに、自然言語プロンプトでウェブサイトやローカルドキュメント(XML、HTML、JSON、Markdown)から抽出したい情報を記述するだけで済みます。

How it works

このライブラリは、大規模言語モデル(LLM)と直接的なグラフロジックを組み合わせてスクレイピングパイプラインを作成します。OpenAI、Groq、Azure、Gemini、MiniMax、あるいは Ollama 経由のローカルモデルなど、さまざまな LLM プロバイダーと統合可能です。データ抽出の際は、ユーザーがプロンプトとソース URL またはファイルを提供し、ライブラリがコンテンツ取得(Playwright 使用)と LLM 主導の抽出プロセスを処理します。

Who it’s for

ウェブやローカルファイルから構造化データを抽出したいが、従来のスクレイピングツールに伴う保守コストを避けたい開発者やデータサイエンティスト向けです。また、Langchain、Llama Index、Crew.ai といったエージェントフレームワークとも統合されています。

Highlights

  • Prompt-based extraction:CSS セレクタではなく自然言語でデータを抽出します。
  • Multiple pipeline types:単一ページスクレイピング用 (SmartScraperGraph)、マルチページスクレイピング用 (SmartScraperMultiGraph)、検索エンジンベースのスクレイピング用 (SearchGraph)、Python スクリプトや音声ファイル生成用 (ScriptCreatorGraphSpeechGraph) の専門グラフを含みます。
  • Flexible LLM support:クラウド API と Ollama 経由のローカル LLM の両方に対応しています。
  • Broad integration ecosystem:Zapier、n8n、Bubble といったローコードツールや、Langchain、Llama Index といったエージェントフレームワークと連携可能です。