webclaw: 一個將網站轉換為乾淨 Markdown 和結構化資料的網頁擷取引擎,專為 AI 代理人設計
webclaw: 一個將網站轉換為乾淨 Markdown 和結構化資料的網頁擷取引擎,專為 AI 代理人設計 一個網頁擷取工具,可將網站轉換為乾淨的 Markdown、JSON 和 LLM 就緒內容,供 AI 代理人和 RAG 管線使用。
webclaw: 一個將網站轉換為乾淨 Markdown 和結構化資料的網頁擷取引擎,專為 AI 代理人設計
它解決的問題
網頁擷取工具經常產出要么被機器人偵測阻擋,要么充斥無關的樣板內容(導覽、腳本、廣告),這些內容會雜亂 AI 代理人和 RAG 管線的上下文視窗。webclaw 將網站轉換為乾淨且結構化的格式,如 Markdown 或 JSON,移除噪音並提供 LLM 就緒的內容。
它是如何運作的
webclaw 提供一個核心擷取引擎,將 HTML 處理為簡化的格式。它提供多種與工具互動的方式:
- Local Execution: 一個 CLI 和 MCP 伺服器,無需帳戶即可進行基本擷取。
- Hosted API: 一項雲端服務,用於處理 JavaScript 渲染、受 bot 保護的網站以及複雜的研究任務。
- SDKs: 用於 TypeScript、Python 和 Go 的函式庫,可將擷取功能整合到應用程式中。
- MCP Server: 一個 Model Context Protocol 伺服器,允許 AI 代理人(如 Claude 或 Cursor)將擷取和爬取視為原生工具使用。
它的目標對象
正在構建 AI 代理人、RAG(檢索增強生成)管線的開發者,以及需要將雜亂的網頁轉換為高品質結構化資料以供 LLMs 使用的研究人員。
主要特點
- LLM-Optimized Formats: 專為 Markdown、JSON 以及供代理人使用的緊湊
llm格式設計的輸出。 - Agent Integration: 提供 MCP 的原生支援,使代理人能直接擷取、爬取和總結頁面。
- Crawl and Map: 能夠跟隨連結來探索並擷取完整的文件站點。
- Local-First Approach: 核心擷取邏輯在本地可用,同時提供雲端 API 以滿足如 JS 渲染等進階需求。
- Brand Intelligence: 專門用於提取品牌資產(如顏色、字體和標誌)的工具。
Sources
- Repo0xMassi/webclaw