magicrew/doc7
Turn documents into AI-ready Markdown with visual understanding
何を解決するか
doc7 は、PDF、Officeファイル、スキャン画像、スクリーンショット、チャート、図表など複雑なドキュメントを、AI対応のMarkdownに変換するツールです。従来のOCRやテキスト抽出では、数式、表、図の関係性などの構造的・視覚的情報が失われる問題を解決し、AIモデルがより検索可能で論理的に処理できる形にドキュメントを整えます。
動作方法
従来のOCRスタックやファイル形式ごとのパーサーに頼るのではなく、doc7 はページ全体の視覚的理解アプローチを採用しています。ドキュメントページを画像としてレンダリングし、OpenAI互換のマルチモーダル(視覚)モデルで処理します。これにより、視覚的要素を含むページの内容をMarkdownとして再構成できます。ユーザーはLM StudioやOllamaを介してローカルでこれらのモデルを実行でき、プライバシーを守り、ページ単位のAPIコストを完全に回避できます。
対象ユーザー
- AI開発者: 多様なドキュメント形式から高品質で構造化されたMarkdownを必要とするRAGパイプラインを構築している人。
- プライバシーを重視するユーザー: データをクラウドAPIに送信せずに、ローカルのビジョンモデルでドキュメントを処理したい個人や組織。
- セルフホスティングユーザー: クラウドプロバイダーからの継続的なドキュメント解析料を削減したいユーザー。
特徴
- マルチモーダルパイプライン: PDF、Office、画像などすべての形式に同じ視覚理解パイプラインを使用。別々のOCR/レイアウトモデルを必要としない。
- ローカルモデル対応: OllamaやLM Studioによるローカルデプロイを含む、任意のOpenAI互換マルチモーダルモデルと互換性がある。
- ゼロマージナルコスト: ローカルハードウェアを使用すれば、ページ単位の料金やドキュメントクレジットが一切不要。
- 強力なリカバリ機能: 失敗したページの再開が可能で、特定のページを異なるモデルで再処理できる。
- 多様なインターフェース: クロスプラットフォームCLI、Go SDK、MCPツール、非同期HTTPサービスとして提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト