0xMassi/webclaw

Fast, local-first web content extraction for LLMs. Scrape, crawl, extract structured data — all from Rust. CLI, REST API, and MCP server.

它解决了什么

网页抓取工具经常产生的输出要么被机器人检测阻止,要么充斥着无关的样板代码(导航、脚本、广告),这些会杂乱 AI 代理和 RAG 管道的上下文窗口。webclaw 将网站转换为干净、结构化的格式,如 Markdown 或 JSON,去除噪声并提供 LLM 就绪的内容。

它是如何工作的

webclaw 提供一个核心提取引擎,将 HTML 处理为简化的格式。它提供了多种与工具交互的方式:

  • 本地执行: 一个 CLI 和 MCP 服务器,无需账户即可进行基本提取。
  • 托管 API: 一项云服务,用于处理 JavaScript 渲染、受机器人保护的站点以及复杂的研究任务。
  • SDKs: 用于 TypeScript、Python 和 Go 的库,以便将提取集成到应用程序中。
  • MCP 服务器: 一个模型上下文协议服务器,允许 AI 代理(如 Claude 或 Cursor)将抓取和爬取作为原生工具使用。

它适用于谁

构建 AI 代理、RAG(检索增强生成)管道的开发者,以及需要将杂乱的网页转换为高质量、结构化数据以供 LLMs 使用的研究人员。

亮点

  • LLM 优化格式: 专门为 Markdown、JSON 以及代理的紧凑 llm 格式设计的输出。
  • 代理集成: 原生支持 MCP,使代理能够直接抓取、爬取和总结页面。
  • 爬取和映射: 能够跟随链接以发现并提取整个文档站点。
  • 本地优先方法: 核心提取逻辑在本地可用,同时提供托管 API 以满足如 JS 渲染等高级需求。
  • 品牌智能: 用于提取品牌资产(如颜色、字体和徽标)的专用工具。