Falcon Perception 및 Falcon OCR 출시

Falcon Perception 및 Falcon OCR 출시

TL;DR

Hugging Face와 Technology Innovation Institute (TII)는 Falcon Perception이라는 0.6B 파라미터 초기 융합 트랜스포머를 공개했으며, 이는 오픈 보카뷸러리 그라운딩 및 세그멘테이션을 위해 설계되었습니다. 또한 Falcon OCR이라는 0.3B 파라미터 모델을 고처리량 문서 이해를 위해 공개했습니다. 모듈식 파이프라인을 단일 스택 트랜스포머 아키텍처로 교체함으로써, 이 모델들은 구성적 그라운딩 및 OCR 처리량에서 최첨단 성능을 달성하면서도 계산 효율성을 유지합니다.

Falcon Perception: 아키텍처 및 설계

Falcon Perception은 이미지 패치와 텍스트 토큰을 첫 번째 레이어부터 공유 파라미터 공간에서 처리하는 단일 초기 융합 트랜스포머 백본을 활용하여, 별도의 비전 백본 및 후기 융합 디코더가 필요하지 않게 합니다.

하이브리드 어텐션 및 시퀀스 처리

시각 데이터와 텍스트 데이터의 서로 다른 구조를 처리하기 위해, 모델은 하이브리드 어텐션 마스크를 사용합니다:

  • Image tokens는 전역 시각 컨텍스트를 구축하기 위해 양방향 어텐션을 사용합니다.
  • Text and task tokens는 인과 어텐션을 사용하여 시각 프리픽스와 이전 모든 텍스트에 주목합니다.

Chain-of-Perception 인터페이스

가변 길이의 밀집 예측(0개부터 수백 개의 인스턴스까지)을 관리하기 위해, 모델은 Chain-of-Perception이라는 구조화된 자동회귀 인터페이스를 사용합니다. 각 인스턴스는 세 단계의 순차적 단계로 분해됩니다:

  1. <coord>: 인스턴스의 중심을 예측합니다.
  2. <size>: 공간적 범위를 예측합니다.
  3. <seg>: 업샘플된 이미지 특징과 내적하여 전체 해상도 이진 마스크를 생성하는 단일 임베딩을 생성합니다.

특수화된 출력 헤드

  • Coordinate & Size Heads: 스펙트럼 바이어스를 극복하고 위치 정확도를 향상시키기 위해 푸리에 특징 인코딩(고차원 사인파 공간으로의 무작위 가우시안 투영)을 사용합니다. 디코딩된 좌표는 이후 토큰을 조건화하기 위해 시퀀스에 다시 주입됩니다.
  • Segmentation Head: <seg> 토큰의 은닉 상태와 콘텐츠 인식 업샘플 이미지 특징 간의 내적을 수행하여, Hungarian 매칭이나 별도의 마스크-쿼리 메커니즘이 필요 없게 합니다.

PBench: 새로운 진단 벤치마크

TII는 PBench를 도입했으며, 이는 요구되는 주요 능력에 따라 샘플을 분류하여 특정 인식 실패를 격리하도록 설계된 벤치마크입니다:

레벨 능력 예시 프롬프트
L0 간단한 객체 "자동차"
L1 속성 및 하위 유형 "빨간 자동차", "부서진 울타리"
L2 OCR 기반 식별 "다이어트 콜라 병", "나이키 신발"
L3 공간 이해 "왼쪽에 있는 자동차", "왼쪽에서 세 번째 창문"
L4 관계 및 상호작용 "우산을 든 사람", "가장 높은 건물"
Dense 혼잡도 스트레스 테스트 이미지당 수백 개의 인스턴스

학습 방법론

다중 교사 증류

Falcon Perception은 강력한 기반을 제공하기 위해 두 비전 교사로부터 증류를 통해 초기화됩니다:

  • DINOv3 (ViT-H): 세그멘테이션을 위한 로컬 특징을 제공합니다.
  • SigLIP2: 오픈 보카뷸러리 이해를 위한 언어 정렬 특징을 제공합니다.

데이터 파이프라인 및 규모

모델은 5,400만 이미지, 1억 9,500만 긍정 표현, 4억 8,800만 하드 네거티브로 학습되었습니다. 파이프라인에는 DINOv3를 통한 계층적 클러스터링, VLM 기반 리스트 작성, 그리고 IoU > 0.8을 요구하는 앙상블 합의(SAM 3, Qwen3-VL-30B, Moondream3)가 포함되었습니다.

3단계 학습 레시피

  1. In-Context Listing (450 GT): 장면 인벤토리를 자동회귀적으로 나열하는 방법을 학습하여 객체 동시 발생을 포착합니다.
  2. Task Alignment (225 GT): 어텐션 마스크를 수정하여 추론 시 독립적인 쿼리를 시뮬레이션하고, 존재 분류와 위치 지정에 대한 그래디언트를 집중시킵니다.
  3. Long-Context Finetuning (10 GT): 마스크 제한을 표현당 600개로 늘려 극단적인 군중 밀도를 위해 모델을 조정합니다.

성능 결과

SA-Co 벤치마크

Falcon Perception (0.6B)은 SA-Co 오픈 보카뷸러리 세그멘테이션 벤치마크에서 68.0 Macro-F1을 달성하여 SAM 3의 62.3을 능가했습니다. 속성 중심(+8.2), 음식·음료(+12.2), 스포츠 장비(+4.0) 분할에서 큰 향상을 보였지만, 존재 보정 측면에서는 SAM 3(MCC 0.64 vs 0.82)보다 뒤처집니다.

PBench 결과

프롬프트 복잡도가 증가함에 따라 Falcon Perception은 SAM 3에 비해 상당한 이점을 보여줍니다:

능력 SAM 3 Falcon Perception 차이
L0: 간단한 객체 64.3 65.1 +0.8
L1: 속성 54.4 63.6 +9.2
L2: OCR 기반 24.6 38.0 +13.4
L3: 공간 31.6 53.5 +21.9
L4: 관계 33.3 49.1 +15.8
밀집 58.4 72.6 +14.2

Falcon OCR

Falcon OCR는 초기 융합 아키텍처의 0.3B-파라미터 변형으로, 세밀한 글리프 인식 및 획 수준 구분을 최적화하기 위해 처음부터 학습되었습니다.

기능 및 벤치마크

Falcon OCR는 다중 열 레이아웃, 수학 공식, 표, 손글씨를 처리합니다. olmOCR에서 80.3%(최고 시스템보다 1.7 포인트 차이)와 OmniDocBench에서 88.64를 달성했으며, 다중 열(87.1%) 및 표(90.3%) 작업에서 모든 모델을 앞섰습니다.

처리량 및 효율성

작은 크기 덕분에 Falcon OCR는 높은 서비스 처리량을 제공합니다. 단일 A100-80GB에서 vLLM을 사용하면 전체 Layout + OCR 파이프라인에 대해 5,825 tok/s2.9 img/s를 달성합니다.

추론 스택

이번 릴리스에는 PyTorch’s FlexAttention을 기반으로 한 추론 스택이 포함되어 있으며, 다음과 같은 특징이 있습니다:

  • Paged KV cache 및 연속 배치를 통해 패딩 낭비를 제거합니다.
  • CUDA graph capture를 디코드 루프에 사용합니다.
  • HR feature cache: 동일 이미지에 대한 후속 쿼리에서 비용이 많이 드는 업샘플링을 건너뛰기 위한 업샘플 이미지 특징에 대한 LRU 캐시입니다.

Sources