alirezamika/autoscraper
A Smart, Automatic, Fast and Lightweight Web Scraper for Python
何を解決するか
AutoScraper は、複雑な CSS セレクターや XPath 式を手動で書く必要をなくし、ウェブスクレイピングを簡素化します。各ウェブサイトにルールをハードコードするのではなく、取得したいデータのいくつかのサンプルを提供するだけで、ツールは同じページや他のページ上の類似要素を見つけるためのパターンを自動的に学習します。
動作方法
このツールは URL または HTML コンテンツと「目的の」サンプルデータのリスト(テキスト、URL、または HTML タグの値など)を受け取ります。ページ構造を分析して、これらのサンプルに基づいてスクレイピングルールを学習します。モデルが構築されると、同じパターンに一致する要素のリスト(類似結果)または提供されたサンプルと同じ順序の特定の要素(正確な結果)を取得するために使用できます。
対象ユーザー
HTML 構造を分析したり、脆弱なセレクタを維持したりする時間を使わず、迅速にウェブサイトからデータを抽出したい Python 開発者。
特徴
- サンプルベースの学習:サンプルデータのリストからスクレイピングルールを自動的に学習。
- 柔軟な抽出:すべての投稿タイトルなどの類似要素や、特定の株価などの特定要素の両方を取得可能。
- モデルの永続化:学習したスクレイピングルールをファイルに保存・読み込み可能で再利用可能。
- カスタムリクエスト:requests モジュールを介してカスタムヘッダーとプロキシをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト