0xMassi/webclaw
Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.
解決的問題
網頁爬蟲工具經常產生被機器人防護機制阻擋,或充斥著原始 HTML、導航選單、腳本和廣告的輸出。webclaw 透過將網站轉換為乾淨、結構化的內容(Markdown、JSON 或 LLM 標準化文字),解決此問題,讓內容可立即用於 AI 代理與 RAG 流程。
如何運作
webclaw 提供一個提取引擎,可移除冗餘內容並保留結構。它可作為 CLI 工具、AI 代理(如 Claude 和 Cursor)使用的 MCP(Model Context Protocol)伺服器,或透過 SDK 與 REST API 使用。它支援核心路徑的本機提取,以及需要 JavaScript 渲染或繞過機器人防護等進階需求的主機 API。
適用對象
需要從 URL 或整個文件網站中提取高品質、無雜訊網路資料的開發者,特別是建構 AI 代理、RAG(檢索增強生成)系統與自動化工作流程的人。
主要特色
- 多種輸出格式:支援 Markdown、LLM 標準化文字、JSON 與純文字。
- 爬取與地圖功能:可追蹤連結以爬取整個網站,或僅建立 URL 地圖而不進行完整提取。
- MCP 整合:原生支援透過 MCP 伺服器讓 AI 代理直接進行爬取、爬行與摘要頁面。
- 本機優先設計:核心提取功能可在無需 API 金鑰的情況下於本機運作,複雜網站則可選擇主機選項。
- 品牌智慧:專用工具可提取品牌資產,如顏色、字型與商標。
- 廣泛整合:提供 TypeScript、Python 與 Go 的 SDK。
"webclaw 讓我們能快速將網站轉換為 AI 可用的結構化資料,大幅簡化了 RAG 系統的資料準備流程。" — @devjoe
相關
- 專案
- 專案
- 專案
- 專案
- 專案