adbar/trafilatura

Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML

解決する課題

Trafilatura は、ウェブからテキストを収集し、生の HTML を構造化された意味のあるデータに変換することを目的としています。ヘッダー、フッター、ボイラープレートなどの「ノイズ」を排除し、実際のメインコンテンツとメタデータに焦点を当てることで、データベースを必要とせずに、信頼性の高い高速な方法で重要な情報を抽出します。

動作方法

Python パッケージおよびコマンドラインツールとして機能し、ウェブクローリング、ダウンロード、スクレイピングを統合します。ルールベースの抽出器(jusText および readability-lxml へのフォールバック付き)を使用して、メインテキストおよびメタデータ(著者、日付、タイトルなど)を特定します。ライブ URL、サイトマップ、フィード(RSS、ATOM、JSON)、事前にダウンロードされた HTML ファイルなど、さまざまな入力ソースをサポートし、JSON、Markdown、TXT、CSV、XML などのフォーマットで出力可能です。

対象ユーザー

自然言語処理(NLP)タスク用のテキストデータベースやコーパスを作成する必要がある開発者、研究者、データサイエンティストを主な対象としています。また、構造化データ抽出のためにウェブコンテンツをクリーニングしたいすべての人々にも適しています。

特徴

  • 包括的なパイプライン:サイトマップ/フィードの発見、ダウンロード、抽出を1つのツールで統合。
  • 高いパフォーマンス:テキスト抽出ベンチマークにおいて、他のオープンソースライブラリを常に上回ります。
  • 高い精度:ボイラープレートやノイズを効果的に除去し、メインコンテンツを明確に分離します。
  • モジュール式で使いやすい:データベース不要。XML-TEI を含む複数の出力フォーマットをサポート。
  • 広範な採用:HuggingFace、NVIDIA、Microsoft Research などの組織で使用されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト