flairNLP/fundus

A very simple news crawler with a funny name

해결하는 문제

Fundus는 온라인 뉴스 기사에서 고품질 텍스트와 이미지를 추출하는 과정을 단순화하기 위해 설계된 뉴스 크롤러입니다. 웹 페이지의 노이즈를 제거하여 연구자와 개발자를 위한 깨끗하고 구조화된 데이터를 제공하며, 특히 높은 추출 정밀도와 재현율을 최적화했습니다.

작동 방식

Fundus는 Python 패키지를 제공하여 라이브 웹사이트 또는 CommonCrawl의 CC-NEWS 아카이브에서 기사를 크롤링할 수 있습니다. PublisherCollection을 사용해 특정 뉴스 출처나 지역 그룹(예: 미국 또는 영국 출판사)을 타겟팅할 수 있습니다. 성능을 높이기 위해 여러 CPU 코어를 사용할 수 있으며, 사이트맵에 제한함으로써 대역폭 사용을 줄일 수 있습니다. 기사 제목, 본문 텍스트, URL, 그리고 상세한 이미지 메타데이터(캡션 및 저작권자 포함)를 추출합니다.

대상 사용자

AI 모델 학습 또는 언어 분석을 위해 대규모이고 깨끗한 뉴스 코퍼스가 필요한 연구자, 데이터 과학자, AI 개발자.

주요 특징

  • 고품질 추출: ROUGE-LSum F1 점수 벤치마크에서 Trafilatura 및 news-please와 같은 다른 스크래퍼보다 우수합니다.
  • 다중 소스 크롤링: 라이브 웹 크롤링과 CC-NEWS 웹 아카이브를 모두 지원하여 대규모 데이터셋을 구축할 수 있습니다.
  • 세부 이미지 파싱: 이미지 URL뿐만 아니라 캡션, 설명, 여러 해상도 버전도 추출합니다.
  • 간편한 통합: 몇 줄의 Python 코드로 수천에서 수백만 개의 기사를 크롤링할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트