lumina-ai-inc/chunkr

Vision infrastructure to turn complex documents into RAG/LLM-ready data

何を解決するか

Chunkr は、PDF、PowerPointプレゼンテーション、Wordドキュメント、画像などの複雑なドキュメントを、構造化されたLLM対応のチャンクに変換するためのドキュメントインテリジェンスAPIです。レイアウト分析、OCR、意味的チャンク化を処理することで、Retrieval-Augmented Generation (RAG)パイプラインに高品質なデータを準備する問題を解決します。

動作方法

このプロジェクトは、レイアウト分析、OCR(バウンディングボックス付き)、およびビジョン・ランゲージモデル(VLM)処理を経るパイプラインを通じてドキュメントを処理する本番環境対応のサービスを提供します。元のファイルを構造化されたHTMLおよびMarkdown形式に変換し、その後LLMで使用可能な意味的チャンクに分割します。オープンソース版ではコミュニティおよびオープンソースモデルを使用していますが、マネージドクラウドAPI版はより高い精度を実現するための独自モデルを使用しています。

対象ユーザー

さまざまなファイル形式のドキュメントパースおよびチャンク化プロセスを自動化したい開発者やAIエンジニア向けです。

主な特徴

  • マルチフォーマット対応: PDF、PPT、Wordドキュメント、画像を処理可能。
  • 構造化出力: LLMの消費に適したHTMLおよびMarkdownを生成。
  • レイアウト分析: バウンディングボックス付きのレイアウト分析とOCRを実行。
  • 柔軟なLLM設定: models.yaml 設定ファイルを介して、OpenAI、Google AI Studio、OpenRouter、およびvLLMやOllamaなどの自前ホスティングオプションを含む複数のLLMプロバイダーに対応。
  • Docker対応: GPU、CPUのみ、Mac ARMアーキテクチャをサポートするDocker Composeによる簡単なデプロイが可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト