Granite 4.0 3B Vision 发布说明 / 新功能
Granite 4.0 3B Vision 发布说明 / 新功能
TL;DR
IBM 发布了 Granite 4.0 3B Vision,这是一款专为企业文档理解而设计的紧凑型视觉语言模型(VLM)。它能够从复杂的文档和表单中高精度提取表格、图表以及语义键值对(KVP),并作为基于 Granite 4.0 Micro 语言模型的模块化 LoRA 适配器运行。
企业文档的关键能力
Granite 4.0 3B Vision 专为从结构化视觉内容和复杂布局中可靠提取信息而打造。其主要能力包括:
- 表格提取:从文档图像中解析复杂的表格结构,包括多行多列格式。
- 图表理解:将图表和图形转换为可执行代码、摘要或结构化的机器可读格式。
- 语义键值对(KVP)提取:在多样的文档布局中识别并定位语义上有意义的字段对。
- 通用视觉语言任务:生成图像的详细自然语言描述。
技术架构与训练
模型的性能得益于三项核心技术投入:专用数据集、改进的特征注入架构以及模块化部署策略。
ChartNet:代码引导的数据增强
为提升图表的空间精度和数值推理能力,IBM 开发了 ChartNet,一个规模达百万级的多模态数据集。
ChartNet 采用代码引导的合成流水线,生成 170 万种多样的图表样本,覆盖 24 种图表类型和 6 种绘图库。每个样本包含五个对齐的组件:绘图代码、渲染图像、数据表、自然语言摘要以及问答对。该方法使模型能够学习视觉表现与底层结构化数据之间的关系。
DeepStack:多层视觉特征注入
与在单一点注入视觉信息的标准 VLM 不同,Granite 4.0 3B Vision 使用 DeepStack 架构 的变体。该方法将抽象的视觉特征路由到更早的层以实现语义理解,同时将高分辨率的空间特征输入到后期层。此双流方式确保模型保留在布局关键的表格和 KVP 解析所需的细粒度细节。
模块化 LoRA 设计
Granite 4.0 3B Vision 以 LoRA 适配器 的形式实现于 Granite 4.0 Micro 密集语言模型之上。这种模块化使单一部署能够同时处理多模态和仅文本工作负载,在不需要视觉功能时自动回退到基础语言模型。
性能基准
Granite 4.0 3B Vision 在多个关键基准上展示了与体积更大的模型竞争的性能:
图表推理
在 ChartNet 基准上通过 LLM-as-a-judge 进行评估:
- Chart2Summary:在所有评估模型中取得最高分(86.4%)。
- Chart2CSV:排名第二,得分 62.1%,仅次于 Qwen3.5-9B 模型(63.4%)。
表格提取
通过 TEDS(评估结构和内容准确性)在三个基准上进行测量:
- PubTables-v2:在裁剪(92.1)和整页(79.3)两种设置下均领先。
- OmniDocBench-tables:取得领先分数 64.0。
- TableVQA-extract:取得领先分数 88.1。
语义 KVP 提取
在 VAREX 基准上,该基准包含 1,777 份复杂程度各异的美国政府表单,模型在零样本设置下实现了 85.5% 完全匹配(EM)准确率。
部署与集成
Granite 4.0 3B Vision 在 Apache 2.0 许可证下发布,可通过两种主要方式集成到工作流中:
独立提取
模型可以直接在单张图像上运行进行针对性的视觉提取,适用于表单解析器或图表分析器等轻量工具。
与 Docling 集成的流水线
与 Docling 配合使用时,模型可用于多页 PDF 的端到端文档理解。在该流水线中,Docling 负责 OCR 与布局解析,以检测并裁剪视觉元素,然后将其传递给 Granite 4.0 3B Vision 进行细粒度提取(例如,将表格转换为 HTML,或将图表转换为 CSV)。