Falcon Perception 및 Falcon OCR 출시
Falcon Perception 및 Falcon OCR 출시
TL;DR
Hugging Face와 Technology Innovation Institute (TII)는 Falcon Perception이라는 0.6B 파라미터 초기 융합 트랜스포머를 공개했으며, 이는 오픈 보카뷸러리 그라운딩 및 세그멘테이션을 위해 설계되었습니다. 또한 Falcon OCR이라는 0.3B 파라미터 모델을 고처리량 문서 이해를 위해 공개했습니다. 모듈식 파이프라인을 단일 스택 트랜스포머 아키텍처로 교체함으로써, 이 모델들은 구성적 그라운딩 및 OCR 처리량에서 최첨단 성능을 달성하면서도 계산 효율성을 유지합니다.
Falcon Perception: 아키텍처 및 설계
Falcon Perception은 이미지 패치와 텍스트 토큰을 첫 번째 레이어부터 공유 파라미터 공간에서 처리하는 단일 초기 융합 트랜스포머 백본을 활용하여, 별도의 비전 백본 및 후기 융합 디코더가 필요하지 않게 합니다.
하이브리드 어텐션 및 시퀀스 처리
시각 데이터와 텍스트 데이터의 서로 다른 구조를 처리하기 위해, 모델은 하이브리드 어텐션 마스크를 사용합니다:
- Image tokens는 전역 시각 컨텍스트를 구축하기 위해 양방향 어텐션을 사용합니다.
- Text and task tokens는 인과 어텐션을 사용하여 시각 프리픽스와 이전 모든 텍스트에 주목합니다.
Chain-of-Perception 인터페이스
가변 길이의 밀집 예측(0개부터 수백 개의 인스턴스까지)을 관리하기 위해, 모델은 Chain-of-Perception이라는 구조화된 자동회귀 인터페이스를 사용합니다. 각 인스턴스는 세 단계의 순차적 단계로 분해됩니다:
<coord>: 인스턴스의 중심을 예측합니다.<size>: 공간적 범위를 예측합니다.<seg>: 업샘플된 이미지 특징과 내적하여 전체 해상도 이진 마스크를 생성하는 단일 임베딩을 생성합니다.
특수화된 출력 헤드
- Coordinate & Size Heads: 스펙트럼 바이어스를 극복하고 위치 정확도를 향상시키기 위해 푸리에 특징 인코딩(고차원 사인파 공간으로의 무작위 가우시안 투영)을 사용합니다. 디코딩된 좌표는 이후 토큰을 조건화하기 위해 시퀀스에 다시 주입됩니다.
- Segmentation Head:
<seg>토큰의 은닉 상태와 콘텐츠 인식 업샘플 이미지 특징 간의 내적을 수행하여, Hungarian 매칭이나 별도의 마스크-쿼리 메커니즘이 필요 없게 합니다.
PBench: 새로운 진단 벤치마크
TII는 PBench를 도입했으며, 이는 요구되는 주요 능력에 따라 샘플을 분류하여 특정 인식 실패를 격리하도록 설계된 벤치마크입니다:
| 레벨 | 능력 | 예시 프롬프트 |
|---|---|---|
| L0 | 간단한 객체 | "자동차" |
| L1 | 속성 및 하위 유형 | "빨간 자동차", "부서진 울타리" |
| L2 | OCR 기반 식별 | "다이어트 콜라 병", "나이키 신발" |
| L3 | 공간 이해 | "왼쪽에 있는 자동차", "왼쪽에서 세 번째 창문" |
| L4 | 관계 및 상호작용 | "우산을 든 사람", "가장 높은 건물" |
| Dense | 혼잡도 스트레스 테스트 | 이미지당 수백 개의 인스턴스 |
학습 방법론
다중 교사 증류
Falcon Perception은 강력한 기반을 제공하기 위해 두 비전 교사로부터 증류를 통해 초기화됩니다:
- DINOv3 (ViT-H): 세그멘테이션을 위한 로컬 특징을 제공합니다.
- SigLIP2: 오픈 보카뷸러리 이해를 위한 언어 정렬 특징을 제공합니다.
데이터 파이프라인 및 규모
모델은 5,400만 이미지, 1억 9,500만 긍정 표현, 4억 8,800만 하드 네거티브로 학습되었습니다. 파이프라인에는 DINOv3를 통한 계층적 클러스터링, VLM 기반 리스트 작성, 그리고 IoU > 0.8을 요구하는 앙상블 합의(SAM 3, Qwen3-VL-30B, Moondream3)가 포함되었습니다.
3단계 학습 레시피
- In-Context Listing (450 GT): 장면 인벤토리를 자동회귀적으로 나열하는 방법을 학습하여 객체 동시 발생을 포착합니다.
- Task Alignment (225 GT): 어텐션 마스크를 수정하여 추론 시 독립적인 쿼리를 시뮬레이션하고, 존재 분류와 위치 지정에 대한 그래디언트를 집중시킵니다.
- Long-Context Finetuning (10 GT): 마스크 제한을 표현당 600개로 늘려 극단적인 군중 밀도를 위해 모델을 조정합니다.
성능 결과
SA-Co 벤치마크
Falcon Perception (0.6B)은 SA-Co 오픈 보카뷸러리 세그멘테이션 벤치마크에서 68.0 Macro-F1을 달성하여 SAM 3의 62.3을 능가했습니다. 속성 중심(+8.2), 음식·음료(+12.2), 스포츠 장비(+4.0) 분할에서 큰 향상을 보였지만, 존재 보정 측면에서는 SAM 3(MCC 0.64 vs 0.82)보다 뒤처집니다.
PBench 결과
프롬프트 복잡도가 증가함에 따라 Falcon Perception은 SAM 3에 비해 상당한 이점을 보여줍니다:
| 능력 | SAM 3 | Falcon Perception | 차이 |
|---|---|---|---|
| L0: 간단한 객체 | 64.3 | 65.1 | +0.8 |
| L1: 속성 | 54.4 | 63.6 | +9.2 |
| L2: OCR 기반 | 24.6 | 38.0 | +13.4 |
| L3: 공간 | 31.6 | 53.5 | +21.9 |
| L4: 관계 | 33.3 | 49.1 | +15.8 |
| 밀집 | 58.4 | 72.6 | +14.2 |
Falcon OCR
Falcon OCR는 초기 융합 아키텍처의 0.3B-파라미터 변형으로, 세밀한 글리프 인식 및 획 수준 구분을 최적화하기 위해 처음부터 학습되었습니다.
기능 및 벤치마크
Falcon OCR는 다중 열 레이아웃, 수학 공식, 표, 손글씨를 처리합니다. olmOCR에서 80.3%(최고 시스템보다 1.7 포인트 차이)와 OmniDocBench에서 88.64를 달성했으며, 다중 열(87.1%) 및 표(90.3%) 작업에서 모든 모델을 앞섰습니다.
처리량 및 효율성
작은 크기 덕분에 Falcon OCR는 높은 서비스 처리량을 제공합니다. 단일 A100-80GB에서 vLLM을 사용하면 전체 Layout + OCR 파이프라인에 대해 5,825 tok/s와 2.9 img/s를 달성합니다.
추론 스택
이번 릴리스에는 PyTorch’s FlexAttention을 기반으로 한 추론 스택이 포함되어 있으며, 다음과 같은 특징이 있습니다:
- Paged KV cache 및 연속 배치를 통해 패딩 낭비를 제거합니다.
- CUDA graph capture를 디코드 루프에 사용합니다.
- HR feature cache: 동일 이미지에 대한 후속 쿼리에서 비용이 많이 드는 업샘플링을 건너뛰기 위한 업샘플 이미지 특징에 대한 LRU 캐시입니다.
Sources
- OriginalFalcon Perception