getmaxun/maxun

🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥

Maxun – 将任何网站转换为结构化 API

什么是它

  • 一个开源、无代码平台,可让你从网络收集数据并将其转换为整洁、结构化的输出(JSON、CSV、Markdown 等)。
  • 它集成了可视化 UI、一组“机器人”(预构建的自动化代理)、CLI 和 SDK,因此你可以通过本地、Docker 或托管服务运行相同的流程。

为什么它对 AI / ML 很重要

  • 现代 LLM 应用需要高质量、结构化的数据。Maxun 可以抓取网站、爬取整个域名,或从 PDF 和图像中提取信息,然后以适用于提示词(prompting)或微调(fine-tuning)的格式输出数据。
  • 它提供了一种 LLM 驱动的提取模式:你可以用自然语言描述你想要的字段,系统会使用语言模型来定位并返回它们,从而减少了手动编写选择器(selectors)的需求。

关键组件

组件 功能 AI 相关功能
Extract 通过点击或记录浏览会话,然后回放以提取结构化数据。 AI Mode – 使用 LLM 来指定提取内容,而不是编写选择器。
Scrape 将完整页面保存为整洁的 Markdown/HTML,并可以捕获截图。 输出适用于 LLM 的 Markdown,用于下游提示词。
Crawl 遍历整个网站,遵循范围规则,并从每个页面提取数据。 可以将大型语料库输入到向量存储或训练流水线中。
Search 自动化网络搜索并收集结果,带有基于时间的过滤器。 有助于为检索增强生成(RAG)收集新鲜数据。
Document Extraction 解析 PDF、DOCX、XLSX、CSV 并对图像进行 OCR。 将扫描文档转换为适用于 LLM 摄入的结构化文本。
SDK / CLI 程序化控制、调度和机器人管理。 支持集成到自定义 AI 流水线或 CI/CD 中。

如何使用它

  1. Hosted quick‑start – 前往 https://app.maxun.dev 并通过 Web UI 创建一个机器人。
  2. Self‑host – 使用 Docker Compose 或直接安装在本地运行服务(参见文档)。这让你对数据和计算拥有完全的控制权。
  3. Automation – 调度机器人定期运行,通过 REST 端点暴露提取的数据,或直接推送到 Google Sheets/Airtable。
  4. LLM integration – 该平台可以以 Model Context Protocol (MCP) 格式输出数据,从而可以轻松地将结果喂给 LLM 提示词或检索增强流水线。

适合人群

  • 数据工程师 & ML 团队,需要一种可靠的方式来获取网络数据,而无需从头编写爬虫。
  • 产品构建者,正在创建需要最新网络信息的 AI 代理。
  • 研究人员,正在收集大型语料库用于训练或评估。
  • 非技术用户,可以使用可视化记录器来构建提取流程。

License

  • AGPL‑v3,这意味着代码可以免费使用和修改,但任何网络部署的服务必须共享其源代码更改。

Bottom line Maxun 弥补了原始网络内容与现代 AI 系统所需的整洁、结构化数据集之间的鸿沟,既提供了无代码 UI,又为自动化和集成提供了开发者友好的工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目