Falcon Perception と Falcon OCR のリリース
Falcon Perception と Falcon OCR のリリース
TL;DR
Hugging Face とテクノロジー・イノベーション・インスティテュート (TII) は、オープンボキャブラリのグラウンディングとセグメンテーションを目的とした 0.6B パラメータの早期融合トランスフォーマー Falcon Perception と、高スループットの文書理解向け 0.3B パラメータモデル Falcon OCR をリリースしました。モジュラーパイプラインを単一スタックのトランスフォーマーアーキテクチャに置き換えることで、これらのモデルは構成的グラウンディングと OCR スループットにおいて最先端の性能を達成しつつ、計算効率も保っています。
Falcon Perception: アーキテクチャと設計
Falcon Perception は、画像パッチとテキストトークンを最初の層から共有パラメータ空間で処理する単一の早期融合トランスフォーマーバックボーンを利用し、別々のビジョンバックボーンや遅延融合デコーダーを必要としません。
ハイブリッドアテンションとシーケンス処理
視覚データとテキストデータの異なる構造に対処するため、モデルは ハイブリッドアテンションマスク を採用します:
- Image tokens は双方向アテンションを使用してグローバルな視覚コンテキストを構築します。
- Text and task tokens は因果アテンションを使用し、視覚プレフィックスとすべての前のテキストに注意を向けます。
Chain-of-Perception インターフェース
可変長の密集予測(ゼロから数百のインスタンス)を管理するため、モデルは Chain-of-Perception と呼ばれる構造化オートレグレッシブインターフェースを使用します。各インスタンスは 3 つの連続したステップに分解されます:
<coord>: インスタンスの中心を予測します。<size>: 空間的範囲を予測します。<seg>: 単一の埋め込みを生成し、アップサンプルされた画像特徴とドット積を取ってフル解像度のバイナリマスクを生成します。
専用出力ヘッド
- Coordinate & Size Heads: フーリエ特徴エンコーディング(高次元正弦空間へのランダムガウス射影)を使用してスペクトルバイアスを克服し、位置精度を向上させます。デコードされた座標はシーケンスに再注入され、後続トークンの条件付けに使用されます。
- Segmentation Head:
<seg>トークンの隠れ状態とコンテンツ認識アップサンプル画像特徴とのドット積を実行し、ハンガリアンマッチングや別個のマスククエリ機構を不要にします。
PBench: 新しい診断ベンチマーク
TII は、必要とされる主要な能力でサンプルを分類し、特定の知覚失敗を分離することを目的としたベンチマーク PBench を導入しました:
| レベル | 能力 | 例プロンプト |
|---|---|---|
| L0 | 単純なオブジェクト | "car" |
| L1 | 属性とサブタイプ | "red car", "broken fence" |
| L2 | OCR ガイドによる識別 | "Diet Coke bottle", "Nike shoes" |
| L3 | 空間的理解 | "car on the left", "third window from left" |
| L4 | 関係と相互作用 | "person holding umbrella", "tallest building" |
| Dense | 混雑度ストレステスト | 画像あたり数百のインスタンス |
トレーニング手法
マルチティーチャーディスティレーション
Falcon Perception は、2 つのビジョンティーチャーからのディスティレーションにより初期化され、強固な基盤を提供します:
- DINOv3 (ViT-H): セグメンテーション用のローカル特徴を提供します。
- SigLIP2: オープンボキャブラリ理解のための言語整合特徴を提供します。
データパイプラインとスケール
モデルは 5,400 万枚の画像、1億9,500 万のポジティブ表現、4億8,800 万のハードネガティブでトレーニングされました。パイプラインには DINOv3 による階層的クラスタリング、VLM 主導のリスティング、そして IoU > 0.8 を自動受理条件とするアンサンブルコンセンサス(SAM 3、Qwen3-VL-30B、Moondream3)が含まれます。
3 段階トレーニングレシピ
- In-Context Listing (450 GT): シーンインベントリをオートレグレッシブにリスト化することを学習し、オブジェクトの共起を捉えます。
- Task Alignment (225 GT): アテンションマスクを変更して推論時に独立クエリをシミュレートし、存在分類と位置特定に勾配を集中させます。
- Long-Context Finetuning (10 GT): マスク上限を表現あたり 600 に引き上げ、極端な混雑密度に対応できるようモデルを適応させます。
パフォーマンス結果
SA-Co ベンチマーク
Falcon Perception (0.6B) は SA‑Co オープンボキャブラリセグメンテーションベンチマークで 68.0 Macro-F1 を達成し、SAM 3 の 62.3 を上回りました。属性が多い (+8.2)、食料・飲料 (+12.2)、スポーツ用品 (+4.0) の各スプリットで大幅な向上を示しましたが、存在校正に関しては SAM 3 に遅れを取っています(MCC 0.64 対 0.82)。
PBench 結果
プロンプトの複雑さが増すにつれて、Falcon Perception は SAM 3 に対して大きな優位性を示します:
| 能力 | SAM 3 | Falcon Perception | 差 |
|---|---|---|---|
| L0: 単純なオブジェクト | 64.3 | 65.1 | +0.8 |
| L1: 属性 | 54.4 | 63.6 | +9.2 |
| L2: OCR ガイド | 24.6 | 38.0 | +13.4 |
| L3: 空間 | 31.6 | 53.5 | +21.9 |
| L4: 関係 | 33.3 | 49.1 | +15.8 |
| Dense | 58.4 | 72.6 | +14.2 |
Falcon OCR
Falcon OCR は、細かいグリフ認識とストロークレベルの識別を最適化するためにスクラッチで学習された、早期融合アーキテクチャの 0.3B パラメータ バリアントです。
能力とベンチマーク
Falcon OCR はマルチカラムレイアウト、数式、表、手書き文字を処理します。olmOCR で 80.3%(トップシステムとの差は 1.7 ポイント)と OmniDocBench で 88.64 を達成し、マルチカラム(87.1%)とテーブル(90.3%)タスクで全モデル中トップです。
スループットと効率
小型であるため、Falcon OCR は高いサービングスループットを提供します。単一の A100-80GB 上で vLLM を使用した場合、フル Layout + OCR パイプラインで 5,825 tok/s と 2.9 img/s を達成します。
推論スタック
リリースには PyTorch の FlexAttention に基づく推論スタックが含まれ、以下の機能があります:
- Paged KV cache と連続バッチングにより、パディングの無駄を排除します。
- デコードループ用の CUDA graph capture。
- HR feature cache: 同一画像に対する後続クエリで高価なアップサンプリングを省くためのアップサンプル画像特徴用 LRU キャッシュ。
Sources
- OriginalFalcon Perception