Falcon Perception 与 Falcon OCR 发布
Falcon Perception 和 Falcon OCR 发布
TL;DR
Hugging Face 和技术创新研究所(TII)发布了 Falcon Perception,一种 0.6B 参数的早期融合 Transformer,旨在实现开放词汇的定位和分割;以及 Falcon OCR,一种 0.3B 参数的高吞吐量文档理解模型。通过用单栈 Transformer 架构取代模块化流水线,这些模型在组合定位和 OCR 吞吐量方面实现了业界领先的性能,同时保持计算效率。
Falcon Perception:架构与设计
Falcon Perception 使用单一的早期融合 Transformer 主干,从第一层起在共享参数空间中处理图像块和文本标记,省去了独立视觉主干和后期融合解码器的需求。
混合注意力与序列处理
为处理视觉和文本数据结构的差异,模型采用 混合注意力掩码:
- 图像标记 使用双向注意力来构建全局视觉上下文。
- 文本和任务标记 使用因果注意力,关注视觉前缀以及所有前置文本。
感知链接口
为管理可变长度的密集预测(从零到数百实例),模型使用一种结构化自回归接口,称为 Chain-of-Perception。每个实例被分解为三个顺序步骤:
<coord>:预测实例的中心。<size>:预测空间范围。<seg>:生成单个嵌入,与上采样的图像特征进行点积,以生成全分辨率二值掩码。
专用输出头
- 坐标与尺寸头:使用傅里叶特征编码(随机高斯投影到高维正弦空间)以克服频谱偏差并提升定位精度。解码后的坐标会重新注入序列,以条件化后续标记。
- 分割头:对
<seg>标记的隐藏状态与感知内容的上采样图像特征进行点积,省去匈牙利匹配或独立掩码查询机制的需求。
PBench:全新诊断基准
TII 推出了 PBench,一个旨在通过按所需主导能力对样本进行分类,以隔离特定感知失误的基准:
| 级别 | 能力 | 示例提示 |
|---|---|---|
| L0 | 简单对象 | "car" |
| L1 | 属性与子类型 | "red car", "broken fence" |
| L2 | 基于 OCR 的识别 | "Diet Coke bottle", "Nike shoes" |
| L3 | 空间理解 | "car on the left", "third window from left" |
| L4 | 关系与交互 | "person holding umbrella", "tallest building" |
| Dense | 密集 | 拥挤度压力测试 |
训练方法论
多教师蒸馏
Falcon Perception 通过从两个视觉教师进行蒸馏进行初始化,以提供坚实的基础:
- DINOv3 (ViT-H):提供用于分割的局部特征。
- SigLIP2:提供用于开放词汇理解的语言对齐特征。
数据流水线与规模
模型在 5400 万图像、1.95 亿正表达式和 4.88 亿硬负例上进行训练。流水线包括通过 DINOv3 的层次聚类、VLM 驱动的列举,以及一个集合共识(SAM 3、Qwen3-VL-30B 和 Moondream3),要求 IoU > 0.8 才能自动接受。
三阶段训练配方
- 上下文内列举 (450 GT):学习自回归列举场景清单,捕获对象共现。
- 任务对齐 (225 GT):修改注意力掩码以在推理时模拟独立查询,聚焦梯度于存在分类和定位。
- 长上下文微调 (10 GT):通过将每个表达式的掩码上限提升至 600,适配极端拥挤密度。
性能结果
SA-Co 基准
Falcon Perception(0.6B)在 SA-Co 开放词汇分割基准上取得 68.0 Macro-F1,超过 SAM 3 的 62.3。在属性丰富(+8.2)、食品饮料(+12.2)和体育器材(+4.0)子集上表现显著提升,然而在存在校准方面落后于 SAM 3(MCC 0.64 对比 0.82)。
PBench 结果
随着提示复杂度的提升,Falcon Perception 相较 SAM 3 展示出显著优势:
| 能力 | SAM 3 | Falcon Perception | 差距 |
|---|---|---|---|
| L0:简单对象 | 64.3 | 65.1 | +0.8 |
| L1:属性 | 54.4 | 63.6 | +9.2 |
| L2:基于 OCR | 24.6 | 38.0 | +13.4 |
| L3:空间 | 31.6 | 53.5 | +21.9 |
| L4:关系 | 33.3 | 49.1 | +15.8 |
| Dense | 58.4 | 72.6 | +14.2 |
Falcon OCR
Falcon OCR 是一种 0.3B 参数 的早期融合架构变体,从头训练,以优化细粒度字形识别和笔画级别区分。
能力与基准
Falcon OCR 能处理多列布局、数学公式、表格和手写体。它在 olmOCR 上取得 80.3%(距最佳系统仅 1.7 分),在 OmniDocBench 上取得 88.64,在多列(87.1%)和表格(90.3%)任务上领先所有模型。
吞吐量与效率
由于体积小,Falcon OCR 提供高服务吞吐量。在单个 A100-80GB 上使用 vLLM,可实现 5,825 tok/s 和 2.9 img/s 的完整布局 + OCR 流水线。
推理栈
此次发布包含基于 PyTorch 的 FlexAttention 的推理栈,特性包括:
- Paged KV 缓存 与连续批处理,以消除填充浪费。
- CUDA 图捕获 用于解码循环。
- HR 特征缓存:用于上采样图像特征的 LRU 缓存,以在对同一图像的后续查询中跳过昂贵的上采样。
Sources
- OriginalFalcon Perception