flairNLP/fundus

A very simple news crawler with a funny name

What it solves

Fundusは、オンラインニュース記事から高品質なテキストと画像を抽出するプロセスを簡素化するために設計されたニュースクローラーです。ウェブページのノイズを除去し、研究者や開発者のためにクリーンで構造化されたデータを提供します。特に、高い抽出精度と再現率(recall)に最適化されています。

How it works

Fundusは、ライブウェブサイトまたはCommonCrawlのCC-NEWSアーカイブから記事をクロールするためのPythonパッケージを提供します。PublisherCollectionを使用して、特定のニュースソースや地域グループ(例:USまたはUKのパブリッシャー)をターゲットにすることができます。クローラーは、パフォーマンス向上のために複数のCPUコアを使用するように設定でき、帯域幅の使用量を抑えるためにソースをサイトマップに制限することも可能です。記事のタイトル、本文、URL、および詳細な画像メタデータ(キャプションや著作権保持者を含む)を抽出します。

Who it’s for

AIモデルのトレーニングや言語学的分析を行うために、大規模でクリーンなニュースコーパスを必要とする研究者、データサイエンティスト、およびAI開発者です。

Highlights

  • High Extraction Quality: ROUGE-LSum F1-scoreベンチマークにおいて、Trafilaturaやnews-pleaseなどの他のスクレイパーよりも優れた性能を発揮します。
  • Multi-Source Crawling: ライブウェブのクロールと、大規模データセットのためのCC-NEWSウェブアーカイブの両方をサポートしています。
  • Detailed Image Parsing: 画像URLだけでなく、キャプション、説明、および複数の解像度バージョンも抽出します。
  • Easy Integration: わずか数行のPythonコードで、数千または数百万の記事をクロールすることが可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト