Falcon Perception 與 Falcon OCR 發布

Falcon Perception and Falcon OCR 發布

TL;DR

Hugging Face 與科技創新研究院(Technology Innovation Institute,簡稱 TII)已發布 Falcon Perception,一個 0.6B 參數的早期融合 Transformer,旨在開放詞彙的定位與分割;以及 Falcon OCR,一個 0.3B 參數的高吞吐量文件理解模型。透過以單一堆疊 Transformer 架構取代模組化管線,這些模型在組合式定位與 OCR 吞吐量上達到最先進的表現,同時保持計算效率。

Falcon Perception:架構與設計

Falcon Perception 採用單一早期融合的 Transformer 骨幹,從第一層起即在共享參數空間中同時處理影像 patch 與文字 token,省去獨立視覺骨幹與後期融合解碼器的需求。

混合注意力與序列處理

為了處理視覺與文字資料結構的差異,模型使用 混合注意力遮罩

  • 影像 token 使用雙向注意力以建立全域視覺上下文。
  • 文字與任務 token 使用因果注意力,關注視覺前綴與所有先前的文字。

Chain-of-Perception 介面

為了管理可變長度的密集預測(從零到數百個實例),模型使用稱為 Chain-of-Perception 的結構化自回歸介面。每個實例被分解為三個連續步驟:

  1. <coord>:預測實例的中心。
  2. <size>:預測空間範圍。
  3. <seg>:產生單一嵌入,與上採樣的影像特徵做點積,以生成全解析度的二元遮罩。

專用輸出頭

  • 座標與尺寸頭:使用傅立葉特徵編碼(隨機高斯投影至高維正弦空間)以克服頻譜偏差並提升定位精度。解碼後的座標會重新注入序列,以條件化後續 token。
  • 分割頭:在 <seg> token 的隱藏狀態與具內容感知的上採樣影像特徵之間執行點積,省去 Hungarian 匹配或獨立遮罩查詢機制的需求。

PBench:全新診斷基準

TII 推出 PBench,一項旨在透過依據所需主要能力對樣本分類,以孤立特定感知失敗的基準:

層級 能力 範例提示
L0 簡單物件 "car"
L1 屬性與子類型 "red car", "broken fence"
L2 OCR 引導的辨識 "Diet Coke bottle", "Nike shoes"
L3 空間理解 "car on the left", "third window from left"
L4 關係與互動 "person holding umbrella", "tallest building"
Dense 擁擠度壓力測試 每張影像數百個實例

訓練方法論

多教師蒸餾

Falcon Perception 透過兩位視覺教師的蒸餾進行初始化,以提供堅實的基礎:

  • DINOv3 (ViT-H):提供用於分割的局部特徵。
  • SigLIP2:提供語言對齊的特徵,以支援開放詞彙的理解。

資料管線與規模

模型在 5400 萬張影像、1.95 億正向描述與 4.88 億硬負樣本上進行訓練。管線包含透過 DINOv3 的階層式聚類、VLM 驅動的列舉,以及一個由 (SAM 3、Qwen3-VL-30B、Moondream3) 組成的集合共識,需 IoU > 0.8 才會自動接受。

三階段訓練流程

  1. 情境內列舉 (450 GT):學習自回歸列舉場景清單,捕捉物件共現。
  2. 任務對齊 (225 GT):調整注意力遮罩以模擬推論時的獨立查詢,將梯度聚焦於存在分類與定位。
  3. 長情境微調 (10 GT):透過將每個描述的遮罩上限提升至 600,讓模型適應極端擁擠密度。

效能結果

SA-Co 基準

Falcon Perception(0.6B)在 SA-Co 開放詞彙分割基準上取得 68.0 Macro-F1,超過 SAM 3 的 62.3。在屬性豐富(+8.2)、食物與飲料(+12.2)以及運動器材(+4.0)等子集上顯示顯著提升,然而在存在校準方面落後於 SAM 3(MCC 0.64 對 0.82)。

PBench 結果

隨著提示複雜度提升,Falcon Perception 相較於 SAM 3 展現出顯著優勢:

能力 SAM 3 Falcon Perception 差距
L0:簡單物件 64.3 65.1 +0.8
L1:屬性 54.4 63.6 +9.2
L2:OCR 引導 24.6 38.0 +13.4
L3:空間 31.6 53.5 +21.9
L4:關係 33.3 49.1 +15.8
密集 58.4 72.6 +14.2

Falcon OCR

Falcon OCR 是早期融合架構的 0.3B 參數 變體,從頭訓練以優化細粒度字形辨識與筆畫層級的區分。

能力與基準

Falcon OCR 能處理多欄版面、數學公式、表格與手寫文字。它在 olmOCR 上取得 80.3%(距最佳系統僅差 1.7 分),在 OmniDocBench 上取得 88.64,在多欄(87.1%)與表格(90.3%)任務上領先所有模型。

吞吐量與效能

由於尺寸小巧,Falcon OCR 提供高服務吞吐量。在單一 A100-80GB 並使用 vLLM 時,完整 Layout + OCR 流程可達 5,825 tok/s2.9 img/s

推論堆疊

此發布包含基於 PyTorch’s FlexAttention 的推論堆疊,具備以下特點:

  • 分頁 KV 快取 與持續批次處理,以消除填充浪費。
  • CUDA 圖形捕獲 用於解碼迴圈。
  • HR 特徵快取:針對上採樣影像特徵的 LRU 快取,以在同一影像的後續查詢中跳過昂貴的上採樣。

Sources