flairNLP/fundus
A very simple news crawler with a funny name
解決的問題
Fundus 是一款新聞爬蟲工具,旨在簡化從線上新聞文章中提取高品質文字與圖片的流程。它能去除網頁中的雜訊,為研究人員與開發者提供乾淨且結構化的資料,特別針對高提取精確度與召回率進行優化。
工作原理
Fundus 提供一個 Python 套件,讓使用者能從即時網站或 CommonCrawl 的 CC-NEWS 資料庫中爬取文章。它使用 PublisherCollection 來針對特定的新聞來源或地區群組(例如美國或英國的出版商)進行目標式爬取。爬蟲可配置使用多個 CPU 核心以提升效能,並可限制僅從網站地圖(sitemap)中抓取,以減少頻寬消耗。它能提取文章標題、主要內容文字、URL,以及詳細的圖片元資料(包含說明文字與版權持有者)。
適用對象
需要大規模、乾淨的新聞語料庫來訓練 AI 模型或進行語言學分析的研究人員、資料科學家與 AI 開發者。
主要特色
- 高品質提取:在 ROUGE-LSum F1 分數的基準測試中,表現優於其他爬蟲工具,如 Trafilatura 和 news-please。
- 多來源爬取:支援即時網路爬取與
CC-NEWS網路存檔,可處理龐大的資料集。 - 詳細的圖片解析:不僅提取圖片 URL,還包含說明文字、描述與多種解析度版本。
- 易於整合:僅需幾行 Python 程式碼,即可爬取數千甚至數百萬篇文章。
相關
- 專案
- 專案
- 專案
- 專案
- 專案