flairNLP/fundus

A very simple news crawler with a funny name

它解决了什么问题

Fundus 是一个新闻爬虫,旨在简化从在线新闻文章中提取高质量文本和图片的过程。它去除网页中的噪声,为研究人员和开发者提供干净、结构化的数据,特别优化了高提取精度和召回率。

它如何工作

Fundus 提供了一个 Python 包,允许用户从实时网站或 CommonCrawl 的 CC-NEWS 归档中抓取文章。它使用 PublisherCollection 来定位特定的新闻来源或地区组(例如美国或英国的出版商)。爬虫可配置为使用多个 CPU 核心以提高性能,并可将来源限制为站点地图以减少带宽使用。它提取文章标题、正文主体、URL 以及详细的图像元数据(包括说明和版权持有者)。

适用于谁

需要大规模、干净新闻语料库以训练 AI 模型或进行语言学分析的研究人员、数据科学家和 AI 开发者。

主要特点

  • 高提取质量:在 ROUGE-LSum F1 分数基准测试中,优于 Trafilatura 和 news-please 等其他爬虫。
  • 多源爬取:支持实时网络爬取和 CC-NEWS 网络存档,适用于大规模数据集。
  • 详细的图像解析:不仅提取图像 URL,还提取说明、描述以及多种分辨率版本。
  • 易于集成:仅需几行 Python 代码即可抓取数千甚至数百万篇文章。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目