adbar/trafilatura
Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML
What it solves
Trafilatura 旨在解决从网络上噪声繁多的 HTML 中提取干净、结构化文本的问题。它帮助用户去除标题、页脚和重复的导航元素等“噪声”,专注于网页的实际主要内容和元数据。
How it works
它作为一个 Python 包和命令行工具运行,结合网页爬取、下载和抓取功能。使用常见模式和通用算法(如 jusText 和 readability)的组合,识别并提取主要文本、作者、日期等元数据,以及评论或表格等可选元素。既可以处理实时 URL,也可以处理事先下载的 HTML 文件,支持站点地图、RSS 等多种发现方式。
Who it’s for
该工具面向需要从网络收集高质量文本数据用于 NLP 任务的研究人员、开发者和数据科学家,也适用于如 HuggingFace、Microsoft Research 等构建大规模文本语料库的组织。
Highlights
- Comprehensive Pipeline: 将发现(站点地图、信息源)、下载和抽取整合在一个工具中。
- Flexible Output: 支持多种格式,包括 TXT、Markdown、JSON、CSV 和 XML-TEI。
- High Performance: 在文本抽取基准测试中始终优于其他开源库。
- Modular Design: 无需数据库,轻量且易于集成到现有工作流中。