magicrew/doc7
Turn documents into AI-ready Markdown with visual understanding
해결하는 문제
doc7는 PDF, Office 파일, 스캔본, 스크린샷, 차트, 다이어그램 등 복잡한 문서를 AI 사용 가능한 Markdown으로 변환하는 도구입니다. 기존 OCR 또는 텍스트 추출 과정에서 수식, 표, 다이어그램의 관계성과 같은 구조적 및 시각적 정보가 손실되는 문제를 해결하여, AI 모델이 더 검색 가능하고 논리적으로 처리할 수 있도록 문서를 정리합니다.
작동 방식
전통적인 OCR 스택이나 파일 형식별 파서에 의존하지 않고, doc7는 전체 페이지의 시각적 이해 방식을 사용합니다. 문서 페이지를 이미지로 렌더링한 후, OpenAI 호환 다중 모달(시각) 모델을 통해 처리합니다. 이를 통해 시각적 요소를 포함한 페이지 내용을 Markdown으로 재구성할 수 있습니다. 사용자는 LM Studio나 Ollama를 통해 이러한 모델을 로컬에서 실행하여 개인정보 보호를 유지하고 페이지당 API 비용을 완전히 제거할 수 있습니다.
대상 사용자
- AI 개발자: 다양한 문서 형식에서 고품질의 구조화된 Markdown을 필요로 하는 RAG 파이프라인을 구축하는 사람.
- 개인정보 보호를 중시하는 사용자: 데이터를 클라우드 API에 전송하지 않고 로컬 시각 모델로 문서를 처리하고자 하는 개인 또는 기관.
- 자체 호스팅 사용자: 클라우드 제공업체로부터 반복적인 문서 분석 비용을 제거하고자 하는 사용자.
주요 특징
- 다중 모달 파이프라인: PDF, Office, 이미지 등 모든 형식에 대해 별도의 OCR/레이아웃 모델이 아닌 하나의 시각 이해 파이프라인을 사용.
- 로컬 모델 지원: Ollama 또는 LM Studio를 통한 로컬 배포를 포함해, OpenAI 호환 다중 모달 모델과 호환 가능.
- 제로 마진 비용: 로컬 하드웨어를 사용할 경우 페이지당 요금이나 문서 크레딧이 전혀 발생하지 않음.
- 강력한 복구 기능: 실패한 페이지의 재시작이 가능하며, 특정 페이지를 다른 모델로 다시 처리할 수 있음.
- 다양한 인터페이스: 크로스플랫폼 CLI, Go SDK, MCP 도구, 비동기 HTTP 서비스로 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트