breezedeus/Pix2Text
An Open-Source Python3 tool with SMALL models for recognizing layouts, tables, math formulas (LaTeX), and text in images, converting them into Markdown format. A free alternative to Mathpix, empowering seamless conversion of visual content into text-based representations. 80+ languages are supported.
해결하는 문제
Pix2Text (P2T)는 Mathpix의 오픈소스 대안으로, 이미지와 PDF 파일을 구조화된 마크다운 형식으로 변환하기 위한 파이썬 툴킷입니다. 특히 수학 공식, 표, 다양한 페이지 레이아웃과 같은 복잡한 콘텐츠를 정확히 인식하고 하나의 디지털 문서에 통합하는 어려움을 해결합니다.
작동 방식
P2T는 전용 AI 모델의 파이프라인을 사용하여 시각 데이터를 처리합니다:
- 레이아웃 분석: DocLayout-YOLO와 같은 모델을 사용하여 페이지의 구조를 식별합니다.
- 수식 검출 및 인식: 전용 MFD(Mathematical Formula Detection) 및 MFR(Mathematical Formula Recognition) 모델을 사용해 수식을 LaTeX/Markdown으로 변환합니다.
- 표 인식: 시각적 표를 마크다운 형식으로 변환합니다.
- 텍스트 인식: CnOCR(영어/중국어용), EasyOCR(80개 이상의 다른 언어용)과 같은 OCR 엔진을 사용해 일반 텍스트를 추출합니다.
- VLM 통합: LiteLLM 인터페이스를 통해 폐쇄형 비전 언어 모델(VLM)을 지원하여 표와 수식의 OCR을 수행합니다.
대상 사용자
- 수작업 또는 인쇄된 수학 노트와 학술 논문을 디지털화해야 하는 연구자 및 학생.
- 복잡한 문서 파싱을 위한 무료 오픈소스 OCR 툴킷을 찾는 개발자.
- 스캔된 PDF를 편집 가능한 마크다운 파일로 변환하고 싶은 사용자.
주요 특징
- 포괄적인 파싱: 텍스트, 표, 수학 공식을 하나의 워크플로우에서 처리합니다.
- 다국어 지원: 텍스트 인식에 80개 이상의 언어를 지원합니다.
- PDF에서 마크다운: 스캔된 이미지를 포함한 전체 PDF 파일을 마크다운으로 변환할 수 있습니다.
- 최첨단 수식 인식: 광범위한 데이터셋으로 훈련된 고정확도 MFR 모델을 사용합니다.
- 유연한 배포: 파이썬 라이브러리, 명령줄 도구, HTTP 서비스, MacOS 데스크톱 앱으로 제공됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트