Falcon Perception 與 Falcon OCR 發布
Falcon Perception and Falcon OCR 發布
TL;DR
Hugging Face 與科技創新研究院(Technology Innovation Institute,簡稱 TII)已發布 Falcon Perception,一個 0.6B 參數的早期融合 Transformer,旨在開放詞彙的定位與分割;以及 Falcon OCR,一個 0.3B 參數的高吞吐量文件理解模型。透過以單一堆疊 Transformer 架構取代模組化管線,這些模型在組合式定位與 OCR 吞吐量上達到最先進的表現,同時保持計算效率。
Falcon Perception:架構與設計
Falcon Perception 採用單一早期融合的 Transformer 骨幹,從第一層起即在共享參數空間中同時處理影像 patch 與文字 token,省去獨立視覺骨幹與後期融合解碼器的需求。
混合注意力與序列處理
為了處理視覺與文字資料結構的差異,模型使用 混合注意力遮罩:
- 影像 token 使用雙向注意力以建立全域視覺上下文。
- 文字與任務 token 使用因果注意力,關注視覺前綴與所有先前的文字。
Chain-of-Perception 介面
為了管理可變長度的密集預測(從零到數百個實例),模型使用稱為 Chain-of-Perception 的結構化自回歸介面。每個實例被分解為三個連續步驟:
<coord>:預測實例的中心。<size>:預測空間範圍。<seg>:產生單一嵌入,與上採樣的影像特徵做點積,以生成全解析度的二元遮罩。
專用輸出頭
- 座標與尺寸頭:使用傅立葉特徵編碼(隨機高斯投影至高維正弦空間)以克服頻譜偏差並提升定位精度。解碼後的座標會重新注入序列,以條件化後續 token。
- 分割頭:在
<seg>token 的隱藏狀態與具內容感知的上採樣影像特徵之間執行點積,省去 Hungarian 匹配或獨立遮罩查詢機制的需求。
PBench:全新診斷基準
TII 推出 PBench,一項旨在透過依據所需主要能力對樣本分類,以孤立特定感知失敗的基準:
| 層級 | 能力 | 範例提示 |
|---|---|---|
| L0 | 簡單物件 | "car" |
| L1 | 屬性與子類型 | "red car", "broken fence" |
| L2 | OCR 引導的辨識 | "Diet Coke bottle", "Nike shoes" |
| L3 | 空間理解 | "car on the left", "third window from left" |
| L4 | 關係與互動 | "person holding umbrella", "tallest building" |
| Dense | 擁擠度壓力測試 | 每張影像數百個實例 |
訓練方法論
多教師蒸餾
Falcon Perception 透過兩位視覺教師的蒸餾進行初始化,以提供堅實的基礎:
- DINOv3 (ViT-H):提供用於分割的局部特徵。
- SigLIP2:提供語言對齊的特徵,以支援開放詞彙的理解。
資料管線與規模
模型在 5400 萬張影像、1.95 億正向描述與 4.88 億硬負樣本上進行訓練。管線包含透過 DINOv3 的階層式聚類、VLM 驅動的列舉,以及一個由 (SAM 3、Qwen3-VL-30B、Moondream3) 組成的集合共識,需 IoU > 0.8 才會自動接受。
三階段訓練流程
- 情境內列舉 (450 GT):學習自回歸列舉場景清單,捕捉物件共現。
- 任務對齊 (225 GT):調整注意力遮罩以模擬推論時的獨立查詢,將梯度聚焦於存在分類與定位。
- 長情境微調 (10 GT):透過將每個描述的遮罩上限提升至 600,讓模型適應極端擁擠密度。
效能結果
SA-Co 基準
Falcon Perception(0.6B)在 SA-Co 開放詞彙分割基準上取得 68.0 Macro-F1,超過 SAM 3 的 62.3。在屬性豐富(+8.2)、食物與飲料(+12.2)以及運動器材(+4.0)等子集上顯示顯著提升,然而在存在校準方面落後於 SAM 3(MCC 0.64 對 0.82)。
PBench 結果
隨著提示複雜度提升,Falcon Perception 相較於 SAM 3 展現出顯著優勢:
| 能力 | SAM 3 | Falcon Perception | 差距 |
|---|---|---|---|
| L0:簡單物件 | 64.3 | 65.1 | +0.8 |
| L1:屬性 | 54.4 | 63.6 | +9.2 |
| L2:OCR 引導 | 24.6 | 38.0 | +13.4 |
| L3:空間 | 31.6 | 53.5 | +21.9 |
| L4:關係 | 33.3 | 49.1 | +15.8 |
| 密集 | 58.4 | 72.6 | +14.2 |
Falcon OCR
Falcon OCR 是早期融合架構的 0.3B 參數 變體,從頭訓練以優化細粒度字形辨識與筆畫層級的區分。
能力與基準
Falcon OCR 能處理多欄版面、數學公式、表格與手寫文字。它在 olmOCR 上取得 80.3%(距最佳系統僅差 1.7 分),在 OmniDocBench 上取得 88.64,在多欄(87.1%)與表格(90.3%)任務上領先所有模型。
吞吐量與效能
由於尺寸小巧,Falcon OCR 提供高服務吞吐量。在單一 A100-80GB 並使用 vLLM 時,完整 Layout + OCR 流程可達 5,825 tok/s 與 2.9 img/s。
推論堆疊
此發布包含基於 PyTorch’s FlexAttention 的推論堆疊,具備以下特點:
- 分頁 KV 快取 與持續批次處理,以消除填充浪費。
- CUDA 圖形捕獲 用於解碼迴圈。
- HR 特徵快取:針對上採樣影像特徵的 LRU 快取,以在同一影像的後續查詢中跳過昂貴的上採樣。
Sources
- OriginalFalcon Perception