flairNLP/fundus

A very simple news crawler with a funny name

解決的問題

Fundus 是一款新聞爬蟲工具,旨在簡化從線上新聞文章中提取高品質文字與圖片的流程。它能去除網頁中的雜訊,為研究人員與開發者提供乾淨且結構化的資料,特別針對高提取精確度與召回率進行優化。

工作原理

Fundus 提供一個 Python 套件,讓使用者能從即時網站或 CommonCrawl 的 CC-NEWS 資料庫中爬取文章。它使用 PublisherCollection 來針對特定的新聞來源或地區群組(例如美國或英國的出版商)進行目標式爬取。爬蟲可配置使用多個 CPU 核心以提升效能,並可限制僅從網站地圖(sitemap)中抓取,以減少頻寬消耗。它能提取文章標題、主要內容文字、URL,以及詳細的圖片元資料(包含說明文字與版權持有者)。

適用對象

需要大規模、乾淨的新聞語料庫來訓練 AI 模型或進行語言學分析的研究人員、資料科學家與 AI 開發者。

主要特色

  • 高品質提取:在 ROUGE-LSum F1 分數的基準測試中,表現優於其他爬蟲工具,如 Trafilatura 和 news-please。
  • 多來源爬取:支援即時網路爬取與 CC-NEWS 網路存檔,可處理龐大的資料集。
  • 詳細的圖片解析:不僅提取圖片 URL,還包含說明文字、描述與多種解析度版本。
  • 易於整合:僅需幾行 Python 程式碼,即可爬取數千甚至數百萬篇文章。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案