adbar/trafilatura
Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML
解決する課題
Trafilatura は、ウェブからテキストを収集し、生の HTML を構造化された意味のあるデータに変換することを目的としています。ヘッダー、フッター、ボイラープレートなどの「ノイズ」を排除し、実際のメインコンテンツとメタデータに焦点を当てることで、データベースを必要とせずに、信頼性の高い高速な方法で重要な情報を抽出します。
動作方法
Python パッケージおよびコマンドラインツールとして機能し、ウェブクローリング、ダウンロード、スクレイピングを統合します。ルールベースの抽出器(jusText および readability-lxml へのフォールバック付き)を使用して、メインテキストおよびメタデータ(著者、日付、タイトルなど)を特定します。ライブ URL、サイトマップ、フィード(RSS、ATOM、JSON)、事前にダウンロードされた HTML ファイルなど、さまざまな入力ソースをサポートし、JSON、Markdown、TXT、CSV、XML などのフォーマットで出力可能です。
対象ユーザー
自然言語処理(NLP)タスク用のテキストデータベースやコーパスを作成する必要がある開発者、研究者、データサイエンティストを主な対象としています。また、構造化データ抽出のためにウェブコンテンツをクリーニングしたいすべての人々にも適しています。
特徴
- 包括的なパイプライン:サイトマップ/フィードの発見、ダウンロード、抽出を1つのツールで統合。
- 高いパフォーマンス:テキスト抽出ベンチマークにおいて、他のオープンソースライブラリを常に上回ります。
- 高い精度:ボイラープレートやノイズを効果的に除去し、メインコンテンツを明確に分離します。
- モジュール式で使いやすい:データベース不要。XML-TEI を含む複数の出力フォーマットをサポート。
- 広範な採用:HuggingFace、NVIDIA、Microsoft Research などの組織で使用されています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト