Falcon Perception 与 Falcon OCR 发布

Falcon Perception 和 Falcon OCR 发布

TL;DR

Hugging Face 和技术创新研究所(TII)发布了 Falcon Perception,一种 0.6B 参数的早期融合 Transformer,旨在实现开放词汇的定位和分割;以及 Falcon OCR,一种 0.3B 参数的高吞吐量文档理解模型。通过用单栈 Transformer 架构取代模块化流水线,这些模型在组合定位和 OCR 吞吐量方面实现了业界领先的性能,同时保持计算效率。

Falcon Perception:架构与设计

Falcon Perception 使用单一的早期融合 Transformer 主干,从第一层起在共享参数空间中处理图像块和文本标记,省去了独立视觉主干和后期融合解码器的需求。

混合注意力与序列处理

为处理视觉和文本数据结构的差异,模型采用 混合注意力掩码

  • 图像标记 使用双向注意力来构建全局视觉上下文。
  • 文本和任务标记 使用因果注意力,关注视觉前缀以及所有前置文本。

感知链接口

为管理可变长度的密集预测(从零到数百实例),模型使用一种结构化自回归接口,称为 Chain-of-Perception。每个实例被分解为三个顺序步骤:

  1. <coord>:预测实例的中心。
  2. <size>:预测空间范围。
  3. <seg>:生成单个嵌入,与上采样的图像特征进行点积,以生成全分辨率二值掩码。

专用输出头

  • 坐标与尺寸头:使用傅里叶特征编码(随机高斯投影到高维正弦空间)以克服频谱偏差并提升定位精度。解码后的坐标会重新注入序列,以条件化后续标记。
  • 分割头:对 <seg> 标记的隐藏状态与感知内容的上采样图像特征进行点积,省去匈牙利匹配或独立掩码查询机制的需求。

PBench:全新诊断基准

TII 推出了 PBench,一个旨在通过按所需主导能力对样本进行分类,以隔离特定感知失误的基准:

级别 能力 示例提示
L0 简单对象 "car"
L1 属性与子类型 "red car", "broken fence"
L2 基于 OCR 的识别 "Diet Coke bottle", "Nike shoes"
L3 空间理解 "car on the left", "third window from left"
L4 关系与交互 "person holding umbrella", "tallest building"
Dense 密集 拥挤度压力测试

训练方法论

多教师蒸馏

Falcon Perception 通过从两个视觉教师进行蒸馏进行初始化,以提供坚实的基础:

  • DINOv3 (ViT-H):提供用于分割的局部特征。
  • SigLIP2:提供用于开放词汇理解的语言对齐特征。

数据流水线与规模

模型在 5400 万图像、1.95 亿正表达式和 4.88 亿硬负例上进行训练。流水线包括通过 DINOv3 的层次聚类、VLM 驱动的列举,以及一个集合共识(SAM 3、Qwen3-VL-30B 和 Moondream3),要求 IoU > 0.8 才能自动接受。

三阶段训练配方

  1. 上下文内列举 (450 GT):学习自回归列举场景清单,捕获对象共现。
  2. 任务对齐 (225 GT):修改注意力掩码以在推理时模拟独立查询,聚焦梯度于存在分类和定位。
  3. 长上下文微调 (10 GT):通过将每个表达式的掩码上限提升至 600,适配极端拥挤密度。

性能结果

SA-Co 基准

Falcon Perception(0.6B)在 SA-Co 开放词汇分割基准上取得 68.0 Macro-F1,超过 SAM 3 的 62.3。在属性丰富(+8.2)、食品饮料(+12.2)和体育器材(+4.0)子集上表现显著提升,然而在存在校准方面落后于 SAM 3(MCC 0.64 对比 0.82)。

PBench 结果

随着提示复杂度的提升,Falcon Perception 相较 SAM 3 展示出显著优势:

能力 SAM 3 Falcon Perception 差距
L0:简单对象 64.3 65.1 +0.8
L1:属性 54.4 63.6 +9.2
L2:基于 OCR 24.6 38.0 +13.4
L3:空间 31.6 53.5 +21.9
L4:关系 33.3 49.1 +15.8
Dense 58.4 72.6 +14.2

Falcon OCR

Falcon OCR 是一种 0.3B 参数 的早期融合架构变体,从头训练,以优化细粒度字形识别和笔画级别区分。

能力与基准

Falcon OCR 能处理多列布局、数学公式、表格和手写体。它在 olmOCR 上取得 80.3%(距最佳系统仅 1.7 分),在 OmniDocBench 上取得 88.64,在多列(87.1%)和表格(90.3%)任务上领先所有模型。

吞吐量与效率

由于体积小,Falcon OCR 提供高服务吞吐量。在单个 A100-80GB 上使用 vLLM,可实现 5,825 tok/s2.9 img/s 的完整布局 + OCR 流水线。

推理栈

此次发布包含基于 PyTorch 的 FlexAttention 的推理栈,特性包括:

  • Paged KV 缓存 与连续批处理,以消除填充浪费。
  • CUDA 图捕获 用于解码循环。
  • HR 特征缓存:用于上采样图像特征的 LRU 缓存,以在对同一图像的后续查询中跳过昂贵的上采样。

Sources