microsoft/markitdown

Python tool for converting files and office documents to Markdown.

What it solves

MarkItDown は、様々なファイル形式を Markdown に変換するために設計された軽量な Python ユーティリティです。Markdown は、ドキュメントの重要な構造(見出し、リスト、表など)を保持しつつ、トークン効率が高く、ほとんどの主流な LLM でネイティブに理解されるため、特に LLM の利用やテキスト分析パイプラインに最適化されています。

How it works

このツールは、PDF、Word、PowerPoint、Excel、HTML、EPubs、およびテキストベースの形式(CSV、JSON、XML)を含む幅広い形式を変換するための統一インターフェースを提供します。組み込みのコンバーターを使用してローカルで動作させることも、クラウドベースのサービスと統合して、より高精度な精細な抽出が可能になります:

  • Local Conversion: Python ライブラリを使用して、一般的なドキュメント形式から内容を抽出します。

  • Azure Integration: Azure Document Intelligence と Azure Content Understanding を統合し、高度なレイアウト分析、OCR、およびマルチモーダル抽出(音声や動画を含む)を行います。

  • LLM-powered OCR: プラグイン(例: markitdown-ocr)を使用して、LLM Vision を用いてドキュメント内の埋め込み画像からテキストを抽出します。

  • LLM Image Descriptions: LLM クライアント(例: OpenAI)を使用して、ファイル内の画像の説明を生成できます。

Who it’s for

RAG (Retrieval-Augmented Generation) パイプラインやテキスト分析ツールを構築している開発者で、非構造化ドキュメントを、LLM が効率的に処理できるクリーンで構造化されたテキスト形式に変換する必要がある方です。

Highlights

  • Broad Format Support: Office 文書、PDF から YouTube URL や音声ファイルまで、あらゆるものを扱います。

  • Multimodal Capabilities: 音声の文字起こしや、LLM を介した画像の説明生成をサポートします。

  • Extensible Architecture: サードパーティ製プラグインによって、新しい変換機能を追加できます。

  • Flexible Deployment: CLI ツール、Python API、または Docker イメージとして利用可能です。

  • Cloud-enhanced Extraction: 複雑なテーブル、スキャンされた PDF、および動画分析のために、Azure サービスとのオプションの統合が可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト