harshankur/officeParser
A robust, strictly-typed Node.js and Browser library for parsing office files into a rich Abstract Syntax Tree (AST) and generating high-fidelity output in multiple formats. Parses: docx · pptx · xlsx · odt · odp · ods · pdf · rtf · csv · md · html. Generates: Markdown · HTML · CSV · RTF · PDF · Plain Text · RAG Chunks
何を解決するか
officeParser は、さまざまなオフィスファイル形式を処理するためのユニバーサルなドキュメントパーサーおよびジェネレーターです。DOCX、PDF、XLSX などの断片化された形式から構造化データを抽出し、他のフォーマットに簡単に変換できる統一された抽象構文木(AST)に変換する問題を解決します。これは、AIパイプラインでも使用可能な形式です。
動作方法
このライブラリは、入力ファイルを豊富で階層的なASTにパースします。このASTは中間表現として機能し、多数の入力および出力フォーマットをサポートできます。ユーザーは OfficeGenerator を使ってこのASTを、Markdown、HTML、またはプレーンテキストなどの特定の出力形式に変換できます。また、Tesseractを介してOCRエンジンも内蔵しており、ドキュメント内の画像からテキストを抽出できます。
対象ユーザー
- 開発者:ドキュメント処理パイプラインを構築する人。
- AI/LLMエンジニア:RAG(リトリーバー補強生成)パイプライン用に高精度のデータを準備する必要がある人。
- Web開発者:オフィスドキュメントをWeb対応フォーマットに変換するツールを開発する人。
特徴
- 広範なフォーマット対応:DOCX、PPTX、XLSX、PDF、ODT、EPUBなどを含む12種類のフォーマットをパース可能。
- RAG対応のチャンク分割:ドキュメント構造、固定サイズ、意味的チャンク分割戦略をネイティブでサポート。
- ASTベースのアーキテクチャ:厳密に型付けされたASTにより、ドキュメントコンテンツの詳細な検査・操作が可能。
- 柔軟な出力形式:Markdown、HTML、CSV、RTF、PDF、EPUB、プレーンテキストを生成可能。
- OCR統合:スキャン済みドキュメントや画像からのテキスト抽出に対応する内蔵OCR機能。
- クロスプラットフォーム:Node.jsとブラウザの両方で動作可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト