jerryjliu/docjev
A very fast document classifier/splitter using Jev
解決する課題
DocJevは、自然言語ルールに基づいてドキュメントを自動的に分類し、大きなPDFパケットを個別のドキュメントに分割する方法を提供します。これは、複数ページのファイル(さまざまな財務報告書が結合されたPDFなど)を手動で並べ替え、隣接するドキュメントが同じカテゴリに属している場合でも、どこでドキュメントが終わり、どこから始まるかを特定する問題を解決します。
仕組み
このシステムは、OCRと意思決定エンジンのパイプラインを使用します。LiteParse(ローカル)またはLlamaParse(複雑なレイアウト用のクラウドベースOCR)を使用して、PDF、DOCX、またはPPTXファイルからテキストを抽出します。このテキストはJev意思決定エンジン(ホスト型サービス)に送信され、自然言語のカテゴリルールを適用して、ドキュメントのカテゴリやページ間の境界を予測します。このプロセスはページ単位で連続的に行われるため、各セグメントのページ範囲を特定します。
対象ユーザー
税務フォーム、プレスリリース、財務報告書などのドキュメントがまとめて送られてくることが多い金融、政府、法律分野など、大量の非構造化ドキュメントパケットを処理する必要があるユーザーや開発者向けに設計されています。
ハイライト
- マルチフォーマット対応: PDF、DOCX、PPTXファイルを処理します。
- 柔軟なルール: YAMLベースの自然言語記述を使用して、カテゴリと分割ロジックを定義します。
- ハイブリッドOCR: LiteParseによるローカル解析と、LlamaParseによるオプションのクラウドベースOCRを提供します。
- レビューフラグ: 不確実な境界やカテゴリの競合を自動的にフラグ付けし、人間によるレビューを促します。
- パフォーマンスベンチマーク: GPT-5.6 Lunaなどの他のモデルと比較した、意思決定のレイテンシと精度の詳細な比較が含まれています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト