adbar/trafilatura
Python & Command-line tool to gather text and metadata on the Web: Crawling, scraping, extraction, output as CSV, JSON, HTML, MD, TXT, XML
What it solves
Trafilatura 旨在解決從網路上雜訊重重的 HTML 中提取乾淨、結構化文字的問題。它協助使用者排除標頭、頁腳與重複的導覽元素等「雜訊」,專注於網頁的實際主要內容與中繼資料。
How it works
它以 Python 套件與指令列工具的形式運作,結合網路爬蟲、下載與抓取功能。透過混合常見模式與通用演算法(如 jusText 與 readability),辨識並抽取主要文字、作者、日期等中繼資料,以及評論或表格等可選元素。可處理即時 URL 或先前下載的 HTML 檔案,支援站點地圖、RSS 等多種發現方式。
Who it’s for
此工具適合需要從網路蒐集高品質文字資料以進行自然語言處理任務的研究人員、開發者與資料科學家,同時也適用於如 HuggingFace、Microsoft Research 等建構大規模文字語料庫的組織。
Highlights
- Comprehensive Pipeline: 結合發現(站點地圖、資訊源)、下載與抽取於同一工具。
- Flexible Output: 支援多種格式,包括 TXT、Markdown、JSON、CSV 與 XML-TEI。
- High Performance: 在文字抽取基準測試中持續優於其他開源函式庫。
- Modular Design: 無需資料庫,輕量且易於整合至現有工作流程。