getmaxun/maxun
🔥 The open-source no-code platform for web scraping, crawling, search and AI data extraction • Turn websites into structured APIs in minutes 🔥
Maxun – 어떤 웹사이트든 구조화된 API로 전환하기
무엇인가요
- 웹에서 데이터를 수집하고 깔끔한 구조화된 출력물(예: JSON, CSV, Markdown 등)로 변환할 수 있는 오픈소스, 노코드 플랫폼입니다.
- 시각적 UI, 사전 구축된 '로봇'(자동화 에이전트), CLI, SDK를 통합하여 동일한 워크플로를 로컬, Docker, 또는 호스팅된 서비스에서 실행할 수 있습니다.
AI/ML에 중요한 이유
- 현대의 LLM 애플리케이션은 고품질의 잘 구조화된 데이터가 필요합니다. Maxun은 웹사이트를 크롤링하거나 전체 도메인을 탐색하거나 PDF 및 이미지에서 정보를 추출한 후, 프롬프팅이나 파인튜닝에 바로 사용할 수 있는 형식으로 데이터를 출력할 수 있습니다.
- LLM 기반 추출 모드를 제공합니다: 자연어로 원하는 필드를 설명하면 언어 모델이 해당 정보를 찾아 반환하므로, 수작업으로 선택자를 작성할 필요가 줄어듭니다.
주요 구성 요소
| 구성 요소 | 기능 | AI 관련 기능 |
|---|---|---|
| Extract | 마우스로 클릭하거나 브라우징 세션을 기록한 후 재생하여 구조화된 데이터를 추출합니다. | AI 모드 – 선택자를 작성하는 대신 언어 모델을 사용해 추출할 내용을 지정합니다. |
| Scrape | 전체 페이지를 깨끗한 Markdown/HTML로 저장하고 스크린샷을 캡처할 수 있습니다. | 후속 프롬프팅에 사용할 수 있는 LLM 준비형 Markdown을 출력합니다. |
| Crawl | 범위 규칙을 존중하며 전체 사이트를 탐색하고 각 페이지에서 데이터를 추출합니다. | 대규모 코퍼스를 벡터 스토어나 학습 파이프라인에 공급할 수 있습니다. |
| Search | 웹 검색을 자동화하고 결과를 수집하며 시간 기반 필터를 지원합니다. | 검색 증강 생성을 위한 최신 데이터 수집에 유용합니다. |
| Document Extraction | PDF, DOCX, XLSX, CSV를 파싱하고 이미지에 OCR을 실행합니다. | 스캔된 문서를 LLM이 처리할 수 있는 구조화된 텍스트로 변환합니다. |
| SDK / CLI | 프로그래밍적 제어, 스케줄링, 로봇 관리. | 사용자 정의 AI 파이프라인 또는 CI/CD에 통합할 수 있습니다. |
사용 방법
- 호스팅된 빠른 시작 –
https://app.maxun.dev로 이동하여 웹 UI를 통해 로봇을 생성합니다. - 자체 호스팅 – Docker Compose 또는 일반 설치를 통해 로컬에서 서비스를 실행합니다(문서 참조). 이 방식은 데이터와 컴퓨팅에 대한 완전한 통제를 제공합니다.
- 자동화 – 로봇을 주기적으로 실행하도록 스케줄링하고, REST 엔드포인트를 통해 추출된 데이터를 공개하거나 Google 시트/Airtable로 직접 전송할 수 있습니다.
- LLM 통합 – 플랫폼은 데이터를 Model Context Protocol (MCP) 형식으로 출력할 수 있어, 결과를 LLM 프롬프트나 검색 증강 파이프라인에 쉽게 공급할 수 있습니다.
누구를 위한가요
- 스크래퍼를 처음부터 작성하지 않고도 신뢰할 수 있는 웹 데이터 수집 방법이 필요한 데이터 엔지니어 및 ML 팀.
- 최신 웹 정보가 필요한 AI 에이전트를 개발하는 제품 빌더.
- 학습이나 평가를 위한 대규모 코퍼스를 수집하는 연구자.
- 시각적 레코더를 사용해 추출 흐름을 구축할 수 있는 비기술 사용자.
라이선스
- AGPL-v3로, 코드는 자유롭게 사용하고 수정할 수 있지만, 네트워크에 배포된 서비스는 소스 변경 사항을 공유해야 합니다.
결론 Maxun은 현대 AI 시스템이 필요로 하는 깨끗하고 구조화된 데이터셋으로의 전환을 가능하게 하며, 노코드 UI와 자동화 및 통합을 위한 개발자 친화적인 도구를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트