getmaxun/maxun

🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥

Maxun – 將任何網站轉換為結構化 API

什麼是 Maxun

  • 一個開源、無程式碼的平台,讓您可以從網頁收集數據並將其轉換為乾淨、結構化的輸出(JSON, CSV, Markdown, 等)。
  • 它整合了視覺化 UI、一組「機器人」(預建的自動化代理)、CLI 和 SDK,因此您可以於本地、Docker 或託管服務上執行相同的流程。

為什麼對 AI / ML 很重要

  • 現代 LLM 應用程式需要高品質、結構良好的數據。Maxun 可以爬取網站、抓取整個網域,或從 PDF 和圖片中提取資訊,然後將數據以適合用於提示詞(prompting)或微調(fine-tuning)的格式輸出。
  • 它提供由 LLM 驅動的提取模式:您可以用自然語言描述您想要的欄位,系統會使用語言模型來定位並返回它們,減少了手動編寫選擇器(selectors)的需求。

關鍵組件

組件 功能 AI 相關功能
Extract 點擊並選擇或記錄瀏覽會話,然後重放它以提取結構化數據。 AI Mode – 使用 LLM 來指定要提取的內容,而非寫入選擇器。
Scrape 將完整頁面保存為乾淨的 Markdown/HTML 並可以擷取螢幕截圖。 輸出適合 LLM 使用的 Markdown,用於後續的提示詞處理。
Crawl 遍歷整個網站,遵守範圍規則,並從每個頁面提取數據。 可以將大型語料庫餵入向量數據庫或訓練管道。
Search 自動化網頁搜尋並收集結果,並帶有基於時間的篩選器。 對於檢索增強生成(RAG)收集新鮮數據非常有用。
Document Extraction 解析 PDF, DOCX, XLSX, CSV 並對圖片進行 OCR。 將掃描文件轉換為適合 LLM 攝入的結構化文本。
SDK / CLI 程式化控制、排程與機器人管理。 實現與自定義 AI 管道或 CI/CD 的整合。

如何使用

  1. 託管快速啟動 – 前往 https://app.maxun.dev 並透過網頁 UI 建立機器人。
  2. 自行託管 – 使用 Docker Compose 或直接安裝(參見文件)在本地運行服務。這讓您對數據和運算資源擁有完全的控制權。
  3. 自動化 – 排程機器人定期運行,透過 REST endpoint 暴露提取的數據,或直接推送到 Google Sheets/Airtable。
  4. LLM 整合 – 平台可以輸出數據以 Model Context Protocol (MCP) 格式,使將結果餵入 LLM 提示詞或檢索增強管道變得非常簡單。

適合對象

  • 數據工程師與 ML 團隊:需要可靠的方式來獲取網頁數據,而無需從頭編寫爬蟲。
  • 產品開發者:正在開發需要最新網頁資訊的 AI 代理程式。
  • 研究人員:正在收集大型語料庫以進行訓練或評估。
  • 非技術用戶:可以使用視覺化記錄器來建立提取流程。

授權方式

  • AGPL-v3,這意味著代碼是免費使用和修改的,但任何網路部署的服務必須分享其源碼變更。

總結 Maxun 彌補了原始網頁內容與現代 AI 系統所需的乾淨、結構化數據集之間的差距,同時提供無程式碼 UI 與開發者友好的工具,用於自動化與整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案