webclaw: 一个将网站转换为干净的 Markdown 和结构化数据的网页提取引擎,供 AI 代理使用
webclaw: 一个将网站转换为干净的 Markdown 和结构化数据的网页提取引擎,供 AI 代理使用
它解决的问题
网页抓取工具经常产生的输出要么被机器人检测阻止,要么充斥着无关的样板代码(导航、脚本、广告),这些会杂乱 AI 代理和 RAG 管道的上下文窗口。webclaw 将网站转换为如 Markdown 或 JSON 等干净、结构化的格式,去除噪声并提供 LLM 就绪的内容。
它是如何工作的
webclaw 提供一个核心提取引擎,将 HTML 处理为简化的格式。它提供了多种与该工具交互的方式:
- Local Execution: 一个无需账户即可工作的 CLI 和 MCP 服务器,用于基本提取。
- Hosted API: 一个云服务,用于处理 JavaScript 渲染、受机器人保护的站点以及复杂的研究任务。
- SDKs: 用于 TypeScript、Python 和 Go 的库,以便将提取集成到应用程序中。
- MCP Server: 一个 Model Context Protocol 服务器,允许 AI 代理(如 Claude 或 Cursor)将抓取和爬取作为原生工具使用。
它适用于谁
构建 AI 代理、RAG(检索增强生成)管道和需要将混乱的网页转换为高质量结构化数据以供 LLMs 使用的开发者和研究人员。
亮点
- LLM-Optimized Formats: 专门为代理设计的输出,适用于 Markdown、JSON 和紧凑的
llm格式。 - Agent Integration: 对 MCP 的原生支持,使代理能够直接抓取、爬取和总结页面。
- Crawl and Map: 能够跟随链接以发现并提取整个文档站点。
- Local-First Approach: 核心提取逻辑在本地可用,同时提供托管 API 以满足如 JS 渲染等高级需求。
- Brand Intelligence: 用于提取品牌资产(如颜色、字体和徽标)的专用工具。
Sources
- Repo0xMassi/webclaw