ttttccxxui/DataInfra-RedactionEverything

DataInfra Series. Redact EVERYTHING with local llms and vlms.

何を解決するか

RedactionEverything は、データをリモートAPIに送信せずに、非構造化ファイル(PDF、Wordドキュメント、画像、テキスト)から機密情報を削除するローカルファーストのドキュメント匿名化ワークベンチです。特に、テキストだけでなく、スタンプ、署名、顔などの視覚的要素を含む、複雑な実世界のビジネス文書(特に中国語-英語の二言語文書)の削除を対象としています。

動作方法

システムは二重パス処理パイプラインを採用しています。

  1. テキスト + OCRパス:PP-StructureV3 を使ってレイアウト解析とOCRを行い、画像やスキャンされたPDFをテキストブロックに変換します。その後、設定可能なスキーマに基づいて機密エンティティを識別するための意味的NERモデル(HaS Text)を使用します。また、赤い会社の印影に隠されたテキストを回復するための「赤インク抑制」フェーズも備えています。
  2. 視覚的特徴パス:LocateAnything-3Bモデルを使って、顔、指紋、身分証明書、銀行カードなどの視覚的特徴を位置特定します。ローカルのOpenCV検出器が、赤い縁や端の印影を補完的に検出します。

両パスの結果を統合・重複除去し、ユーザーがローカルで確認・修正・エクスポートできるようにします。

対象ユーザー

機密性の高いビジネス、法務、金融、医療文書を扱うユーザー向けです。プライバシーの境界を厳格に守る必要がある(ローカル/イントラネット展開)上、複雑なドキュメントレイアウトからテキストおよび視覚的識別子を削除する必要がある方々に最適です。

特徴

  • ローカルファーストのプライバシー:すべての推論とファイル処理はローカルGPUワークステーションまたはイントラネットで実行されます。
  • 視覚的位置特定:1つの位置特定モデルで署名、印影、顔などの非テキスト的機密要素を検出します。
  • 業界固有のプリセット:法務、金融、医療分野向けの事前設定されたスキーマを含みます。
  • 包括的なファイル対応:TXT、DOCX、スキャンされたPDF、さまざまな画像形式をサポートします。
  • 人間が関与するプロセス:最終エクスポート前に認識結果を確認・修正できる完全なワークベンチを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト