flairNLP/fundus
A very simple news crawler with a funny name
해결하는 문제
Fundus는 온라인 뉴스 기사에서 고품질 텍스트와 이미지를 추출하는 과정을 단순화하기 위해 설계된 뉴스 크롤러입니다. 웹 페이지의 노이즈를 제거하여 연구자와 개발자를 위한 깨끗하고 구조화된 데이터를 제공하며, 특히 높은 추출 정밀도와 재현율을 최적화했습니다.
작동 방식
Fundus는 Python 패키지를 제공하여 라이브 웹사이트 또는 CommonCrawl의 CC-NEWS 아카이브에서 기사를 크롤링할 수 있습니다. PublisherCollection을 사용해 특정 뉴스 출처나 지역 그룹(예: 미국 또는 영국 출판사)을 타겟팅할 수 있습니다. 성능을 높이기 위해 여러 CPU 코어를 사용할 수 있으며, 사이트맵에 제한함으로써 대역폭 사용을 줄일 수 있습니다. 기사 제목, 본문 텍스트, URL, 그리고 상세한 이미지 메타데이터(캡션 및 저작권자 포함)를 추출합니다.
대상 사용자
AI 모델 학습 또는 언어 분석을 위해 대규모이고 깨끗한 뉴스 코퍼스가 필요한 연구자, 데이터 과학자, AI 개발자.
주요 특징
- 고품질 추출: ROUGE-LSum F1 점수 벤치마크에서 Trafilatura 및 news-please와 같은 다른 스크래퍼보다 우수합니다.
- 다중 소스 크롤링: 라이브 웹 크롤링과
CC-NEWS웹 아카이브를 모두 지원하여 대규모 데이터셋을 구축할 수 있습니다. - 세부 이미지 파싱: 이미지 URL뿐만 아니라 캡션, 설명, 여러 해상도 버전도 추출합니다.
- 간편한 통합: 몇 줄의 Python 코드로 수천에서 수백만 개의 기사를 크롤링할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트