katanaml/sparrow
Structured data extraction, instruction calling and agentic workflows with ML, LLM and Vision LLM
What it solves
Sparrowは、エンタープライズ向けドキュメントインテリジェンスのために設計されたAPI-firstプラットフォームです。請求書、領収書、銀行明細書、財務諸表などの非構造化ドキュメントを、クリーンで検証済みの構造化されたJSONデータに変換する問題を解決します。また、指示呼び出しとエージェントワークフローを通じて、テキスト処理や意思決定タスクも処理します。
How it works
Sparrowは、タスクに応じて異なる処理パイプラインを組み合わせて使用できるプラグイン式アーキテクチャを採用しています:
- Sparrow Parse: Vision LLMsを利用して、画像や複数ページのPDFから構造化されたJSONを抽出します。
- Sparrow Instructor: Text LLMsを使用して、指示処理、検証、および意思決定を行います。
- Sparrow Agents: Prefectを通じて、カスタムエージェントと視覚的なモニタリングを備えた多段階ワークフローをオーケストレーションします。
このプラットフォームは、さまざまなハードウェア上で動作するように、複数のバックエンドをサポートしています。Apple Silicon用のMLX、NVIDIA GPU用のvLLM、Ollama、およびクラウドベースの抽出用のMistral OCRが含まれます。 すべての処理は、外部APIへの依存を低減するため、ユーザー自身のインフラストラクチャ上で実行可能です。
Who it’s for
複雑なドキュメントからデータの抽出を自動化し、クラウドベースのAIサービスに依存せずに、データをバックエンドパイプラインやデータワークフローに統合したい企業や開発者向けに構築されています。
Highlights
Universal Document Processing: PNG, JPG, および複数ページのPDFを含む幅広い形式をサポートしています。 。
Schema Validation: JSON schemaベースの抽出を使用して、出力データが有効であることを保証します。
Pluggable Backends: MLX, vLLM, Ollama, および Hugging Faceと互換性があります。
Local Execution: セキュリティを強化するためにプライベートインフラストラクチャ上で動作するように設計されており、統合にはRESTful API呼び出しのみが必要です。
Visual Interface: ドラッグ&ドロップでのアップロードとリアルタイムの処理結果を表示するWeb UIが含まれています。