getmaxun/maxun
🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥
Maxun – 將任何網站轉換為結構化 API
什麼是 Maxun
- 一個開源、無程式碼的平台,讓您可以從網頁收集數據並將其轉換為乾淨、結構化的輸出(JSON, CSV, Markdown, 等)。
- 它整合了視覺化 UI、一組「機器人」(預建的自動化代理)、CLI 和 SDK,因此您可以於本地、Docker 或託管服務上執行相同的流程。
為什麼對 AI / ML 很重要
- 現代 LLM 應用程式需要高品質、結構良好的數據。Maxun 可以爬取網站、抓取整個網域,或從 PDF 和圖片中提取資訊,然後將數據以適合用於提示詞(prompting)或微調(fine-tuning)的格式輸出。
- 它提供由 LLM 驅動的提取模式:您可以用自然語言描述您想要的欄位,系統會使用語言模型來定位並返回它們,減少了手動編寫選擇器(selectors)的需求。
關鍵組件
| 組件 | 功能 | AI 相關功能 |
|---|---|---|
| Extract | 點擊並選擇或記錄瀏覽會話,然後重放它以提取結構化數據。 | AI Mode – 使用 LLM 來指定要提取的內容,而非寫入選擇器。 |
| Scrape | 將完整頁面保存為乾淨的 Markdown/HTML 並可以擷取螢幕截圖。 | 輸出適合 LLM 使用的 Markdown,用於後續的提示詞處理。 |
| Crawl | 遍歷整個網站,遵守範圍規則,並從每個頁面提取數據。 | 可以將大型語料庫餵入向量數據庫或訓練管道。 |
| Search | 自動化網頁搜尋並收集結果,並帶有基於時間的篩選器。 | 對於檢索增強生成(RAG)收集新鮮數據非常有用。 |
| Document Extraction | 解析 PDF, DOCX, XLSX, CSV 並對圖片進行 OCR。 | 將掃描文件轉換為適合 LLM 攝入的結構化文本。 |
| SDK / CLI | 程式化控制、排程與機器人管理。 | 實現與自定義 AI 管道或 CI/CD 的整合。 |
如何使用
- 託管快速啟動 – 前往
https://app.maxun.dev並透過網頁 UI 建立機器人。 - 自行託管 – 使用 Docker Compose 或直接安裝(參見文件)在本地運行服務。這讓您對數據和運算資源擁有完全的控制權。
- 自動化 – 排程機器人定期運行,透過 REST endpoint 暴露提取的數據,或直接推送到 Google Sheets/Airtable。
- LLM 整合 – 平台可以輸出數據以 Model Context Protocol (MCP) 格式,使將結果餵入 LLM 提示詞或檢索增強管道變得非常簡單。
適合對象
- 數據工程師與 ML 團隊:需要可靠的方式來獲取網頁數據,而無需從頭編寫爬蟲。
- 產品開發者:正在開發需要最新網頁資訊的 AI 代理程式。
- 研究人員:正在收集大型語料庫以進行訓練或評估。
- 非技術用戶:可以使用視覺化記錄器來建立提取流程。
授權方式
- AGPL-v3,這意味著代碼是免費使用和修改的,但任何網路部署的服務必須分享其源碼變更。
總結 Maxun 彌補了原始網頁內容與現代 AI 系統所需的乾淨、結構化數據集之間的差距,同時提供無程式碼 UI 與開發者友好的工具,用於自動化與整合。
相關
- 專案
- 專案
- 專案
- 專案