Docmatix データセットリリース

Hugging Face は、オープンソースとプロプライエタリな Vision-Language Models(VLM)間の性能ギャップを埋めることを目的とした、Document Visual Question Answering(DocVQA)向けの大規模データセット Docmatix をリリースしました。Docmatix のごく一部で Florence-2 モデルをファインチューニングしたところ、DocVQA ベンチマークで相対的に約 20% の性能向上が得られました。

データセットの規模と構成

Docmatix は、従来の DocVQA データセットと比較して規模が 240 倍に拡大したことを示しています。Idefics2 などのモデルで以前使用されていた主要データセットは 10,000 枚の画像と 39,000 件の質問応答(Q/A)ペアを含んでいましたが、Docmatix は以下を提供します:

  • 画像: 240 万枚
  • Q/A ペア: 950 万件
  • ソース素材: 130 万件の PDF 文書

生成パイプラインと品質管理

Docmatix は、2.1 百万件の PDF を含む PDFA OCR データセットを使用して生成されました。技術的パイプラインは以下のステップで構成されています:

  1. 文字起こしと生成: PDFA からの文字起こしは Phi-3-small モデルで処理され、Q/A ペアが生成されました。
  2. フィルタリング: データ品質を保つため、生成された Q/A ペアの 15% が幻覚として破棄されました。フィルタリングはコードを検出する正規表現と、キーワード「unanswerable」を含む回答を除去することで実施されました。
  3. 画像変換: PDF は解像度 150 dpi の画像に変換され、エンドユーザーの変換リソース負荷を軽減するために Hugging Face Hub にアップロードされました。

プロンプト最適化と多様性

データセットを最適化するため、Hugging Face は最初の小規模バッチデータでアブレーションスタディを実施し、Phi-3 モデル用のプロンプトを洗練しました。最適化目標は以下を含みます:

  • 密度: ページあたり約 4 件の Q/A ペアを目指し、重複(ペアが多すぎる)や詳細不足(ペアが少なすぎる)を防ぎます。
  • 人間らしい回答: 回答が過度に短すぎたり長すぎたりしないようにします。
  • 多様性: 文書内の特定情報に基づく質問を Phi-3 モデルに促すことで、繰り返しを最小限に抑えます(例: "What are the titles of John Doe?")。

パフォーマンスベンチマーク

評価は Florence-2 モデル(700M パラメータ)を使用して実施されました。Florence-2 の 2 つのバージョンを比較しました:標準の DocVQA データセットでファインチューニングしたものと、Docmatix のサブセット(画像の 20%、Q/A ペアの 4%)でファインチューニングし、フォーマット調整のために DocVQA で 1 エポック追加したものです。

データセット DocVQA 上の ANSL モデルサイズ
DocVQA でファインチューニングされた Florence-2 60.1 700M
Docmatix でファインチューニングされた Florence-2 71.4 700M
Idefics2 74.0 8B

結果は、700M パラメータの Florence-2 モデルが Docmatix でファインチューニングされた場合、8B パラメータの Idefics2 モデルに比べてわずか 5% 劣るだけであり、高スケールデータセットの効率性を示しています。

Sources