Granite 4.0 3B Vision 版本說明 / 新功能

Granite 4.0 3B Vision 版本說明 / 新功能

TL;DR

IBM 已發布 Granite 4.0 3B Vision,這是一款專為企業文件理解而設計的緊湊型視覺語言模型 (VLM)。它能高精度地從複雜文件和表單中抽取表格、圖表以及語意鍵值對 (KVP),並作為基於 Granite 4.0 Micro 語言模型的模組化 LoRA 適配器運行。

企業文件的關鍵功能

Granite 4.0 3B Vision 專為從結構化視覺資訊與複雜版面中可靠抽取資訊而打造。其主要功能包括:

  • 表格抽取:從文件影像中解析複雜的表格結構,包括多列和多欄的格式。
  • 圖表理解:將圖表和圖形轉換為可執行程式碼、摘要或結構化的機器可讀格式。
  • 語意鍵值對 (KVP) 抽取:在各種文件版面中識別並定位語意上有意義的欄位對。
  • 一般視覺語言任務:產生圖像的詳細自然語言描述。

技術架構與訓練

模型的效能來自三項主要技術投入:專門的資料集、修改過的特徵注入架構,以及模組化的部署策略。

ChartNet:程式碼導向的資料增強

為提升圖表的空間精度與數值推理能力,IBM 開發了 ChartNet,一個百萬規模的多模態資料集。

ChartNet 使用程式碼導向的合成管線,產生 170 萬筆多樣化的圖表樣本,涵蓋 24 種圖表類型與 6 種繪圖函式庫。每個樣本包含五個對齊的組件:繪圖程式碼、渲染圖像、資料表、自然語言摘要,以及問答對。此方法使模型能學習視覺呈現與底層結構化資料之間的關係。

DeepStack:多層視覺特徵注入

與標準 VLM 在單一點注入視覺資訊不同,Granite 4.0 3B Vision 採用了 DeepStack 架構 的變體。此方法將抽象的視覺特徵傳遞至較早的層以進行語意理解,同時將高解析度的空間特徵注入較後的層。這種雙流方式確保模型保留在版面關鍵的細緻資訊,以實現精確的表格與 KVP 解析。

模組化 LoRA 設計

Granite 4.0 3B Vision 以 LoRA 適配器 的形式實作於 Granite 4.0 Micro 密集語言模型之上。此模組化設計使單一部署即可同時處理多模態與純文字工作負載,且在不需要視覺功能時自動回退至基礎語言模型。

效能基準測試

Granite 4.0 3B Vision 在多項關鍵基準測試中,展現出與規模遠大模型相媲美的效能:

圖表推理

在 ChartNet 基準上以 LLM-as-a-judge 方式評估:

  • Chart2Summary:在所有受評模型中取得最高分 (86.4%)。
  • Chart2CSV:以 62.1% 的分數排名第二,僅次於 Qwen3.5-9B 模型 (63.4%)。

表格抽取

使用 TEDS(同時評估結構與內容正確性)於三個基準測試中測量:

  • PubTables-v2:在裁切 (92.1) 與整頁 (79.3) 兩種設定中皆領先。
  • OmniDocBench-tables:取得領先分數 64.0。
  • TableVQA-extract:取得領先分數 88.1。

語意 KVP 抽取

VAREX 基準(包含 1,777 份美國政府表單,複雜度各異)中,模型在零樣本設定下達到 85.5% 完全匹配 (EM) 準確率

部署與整合

Granite 4.0 3B Vision 以 Apache 2.0 授權釋出,並可透過兩種主要方式整合至工作流程:

獨立抽取

模型可直接在單張影像上執行目標式視覺抽取,適用於輕量化工具,如表單解析器或圖表分析器。

與 Docling 整合的流水線

Docling 結合時,模型可用於多頁 PDF 的端到端文件理解。在此流水線中,Docling 處理 OCR 與版面解析,以偵測並裁切視覺元素,然後將其傳遞給 Granite 4.0 3B Vision 進行細緻抽取(例如將表格轉換為 HTML,或將圖表轉為 CSV)。

Sources