adbar/trafilatura
Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML
해결하는 문제
Trafilatura는 웹에서 텍스트를 수집하고 원시 HTML을 구조화되고 의미 있는 데이터로 변환하기 위해 설계되었습니다. 헤더, 푸터, 레이아웃 코드와 같은 "노이즈"를 제거하고 실제 주요 콘텐츠와 메타데이터에 집중함으로써, 데이터베이스가 필요 없이 신뢰성 있고 빠른 방식으로 핵심 정보를 추출할 수 있습니다.
작동 방식
Python 패키지 및 명령줄 도구로서 웹 크롤링, 다운로드, 스크래핑을 통합합니다. 규칙 기반 추출기(기본적으로 jusText 및 readability-lxml로 백업)를 사용하여 주요 텍스트와 메타데이터(작성자, 날짜, 제목 등)를 식별합니다. 실시간 URL, 사이트맵, 피드(RSS, ATOM, JSON), 사전 다운로드된 HTML 파일 등 다양한 입력 소스를 지원하며, JSON, Markdown, TXT, CSV, XML 등의 형식으로 결과를 출력할 수 있습니다.
대상 사용자
자연어 처리(NLP) 작업을 위한 텍스트 데이터베이스나 코퍼스를 생성해야 하는 개발자, 연구자, 데이터 과학자에게 주로 적합하며, 구조화된 데이터 추출을 위해 웹 콘텐츠를 정리해야 하는 모든 사람에게도 적합합니다.
주요 특징
- 포괄적인 파이프라인: 사이트맵/피드 탐지, 다운로드, 추출을 하나의 도구로 통합.
- 고성능: 텍스트 추출 벤치마크에서 다른 오픈소스 라이브러리를 지속적으로 능가.
- 고정밀도: 레이아웃 코드와 노이즈를 효과적으로 제거하여 주요 콘텐츠를 명확히 분리.
- 모듈식이고 편리함: 데이터베이스 필요 없음. XML-TEI를 포함한 다양한 출력 형식 지원.
- 광범위한 채택: HuggingFace, NVIDIA, Microsoft Research 등 기관에서 사용됨.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트