harshankur/officeParser
A robust, strictly-typed Node.js and Browser library for parsing office files into a rich Abstract Syntax Tree (AST) and generating high-fidelity output in multiple formats. Parses: docx · pptx · xlsx · odt · odp · ods · pdf · rtf · csv · md · html. Generates: Markdown · HTML · CSV · RTF · PDF · Plain Text · RAG Chunks
해결하는 문제
officeParser는 다양한 사무용 파일 형식을 처리할 수 있도록 설계된 유니버설 문서 파서 및 생성기입니다. DOCX, PDF, XLSX와 같은 분할된 형식에서 구조화된 데이터를 추출하고, 다른 형식으로 쉽게 변환할 수 있는 통합된 추상 구문 트리(AST)로 변환하는 문제를 해결합니다. 이는 AI 파이프라인에서도 사용할 수 있는 형식입니다.
작동 방식
이 라이브러리는 입력 파일을 풍부하고 계층적인 AST로 파싱합니다. 이 AST는 중간 표현으로 작동하여, 다양한 입력 및 출력 형식을 지원할 수 있게 합니다. 사용자는 OfficeGenerator를 사용하여 이 AST를 Markdown, HTML, 또는 일반 텍스트와 같은 특정 출력 형식으로 변환할 수 있습니다. 또한 Tesseract를 통해 OCR 엔진도 내장되어 있어 문서 내 이미지에서 텍스트를 추출할 수 있습니다.
대상 사용자
- 개발자: 문서 처리 파이프라인을 구축하는 사람.
- AI/LLM 엔지니어: RAG(검색 기반 증강 생성) 파이프라인용 고정밀 데이터를 준비해야 하는 사람.
- 웹 개발자: 사무 문서를 웹용 형식으로 변환하는 도구를 개발하는 사람.
주요 특징
- 광범위한 형식 지원: DOCX, PPTX, XLSX, PDF, ODT, EPUB 등을 포함한 12가지 형식을 파싱 가능.
- RAG 대응 채우기: 문서 구조, 고정 크기, 의미 기반 채우기 전략을 네이티브로 지원.
- AST 기반 아키텍처: 문서 콘텐츠의 깊이 있는 검사 및 조작을 위한 엄격한 타입 지정 AST 제공.
- 유연한 출력 형식: Markdown, HTML, CSV, RTF, PDF, EPUB, 일반 텍스트 생성 가능.
- OCR 통합: 스캔된 문서 및 이미지에서 텍스트 추출을 위한 내장 OCR 기능.
- 크로스 플랫폼: Node.js와 브라우저 모두에서 작동 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트