ScrapeGraphAI/Scrapegraph-ai
Python scraper based on AI
何を解決するか
ScrapeGraphAI は、手動のセレクタベースのスクレイピングを自然言語プロンプトに置き換えることで、ウェブスクレイピングを簡素化する Python ライブラリです。ユーザーは、各サイトの複雑なパースロジックを書く必要なく、ウェブサイトやローカルドキュメント(XML、HTML、JSON、Markdown)から特定の情報を抽出できます。
動作方法
このライブラリは、大規模言語モデル(LLM)と直接的なグラフ論理の組み合わせを使用して、スクレイピングパイプラインを構築します。ユーザーは、取得したいデータを説明するプロンプトと、ソースの URL やファイルを提供します。システムはページコンテンツを処理し、LLM を使って要求された情報を JSON などの構造化形式に抽出します。
対象ユーザー
ウェブやローカルファイルから構造化データを抽出する必要があり、従来のスクレイピングスクリプトの保守負担を避けたい開発者やデータ研究者向けです。
主な特徴
- 複数のパイプラインタイプ: 単一ページ抽出用(
SmartScraperGraph)、複数ページ抽出用(SearchGraph、SmartScraperMultiGraph)、Python スクリプトや音声ファイル生成用(ScriptCreatorGraph、SpeechGraph)の専用グラフを含みます。 - LLM の柔軟性: OpenAI、Groq、Gemini、Azure などの API を通じて幅広いモデルをサポート。Ollama を通じてローカルでも実行可能。
- 広範な統合: LangChain、LlamaIndex、Crew.ai などの LLM フレームワーク、Zapier や n8n などの低コードツールと統合可能。
- ローカルドキュメント対応: ウェブサイトだけでなく、XML や JSON などのフォーマットのローカルファイルもスクレイピング可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト