alirezamika/autoscraper

A Smart, Automatic, Fast and Lightweight Web Scraper for Python

何を解決するか

AutoScraper は、複雑な CSS セレクターや XPath 式を手動で書く必要をなくし、ウェブスクレイピングを簡素化します。各ウェブサイトにルールをハードコードするのではなく、取得したいデータのいくつかのサンプルを提供するだけで、ツールは同じページや他のページ上の類似要素を見つけるためのパターンを自動的に学習します。

動作方法

このツールは URL または HTML コンテンツと「目的の」サンプルデータのリスト(テキスト、URL、または HTML タグの値など)を受け取ります。ページ構造を分析して、これらのサンプルに基づいてスクレイピングルールを学習します。モデルが構築されると、同じパターンに一致する要素のリスト(類似結果)または提供されたサンプルと同じ順序の特定の要素(正確な結果)を取得するために使用できます。

対象ユーザー

HTML 構造を分析したり、脆弱なセレクタを維持したりする時間を使わず、迅速にウェブサイトからデータを抽出したい Python 開発者。

特徴

  • サンプルベースの学習:サンプルデータのリストからスクレイピングルールを自動的に学習。
  • 柔軟な抽出:すべての投稿タイトルなどの類似要素や、特定の株価などの特定要素の両方を取得可能。
  • モデルの永続化:学習したスクレイピングルールをファイルに保存・読み込み可能で再利用可能。
  • カスタムリクエスト:requests モジュールを介してカスタムヘッダーとプロキシをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト