SmolVLM 256M 與 500M 發布說明
Hugging Face 已發布 SmolVLM-256M 與 SmolVLM-500M,這兩個新輕量級視覺語言模型(VLM)專為受限設備、消費者筆電及瀏覽器推理設計。256M 模型目前是世界上最小的 VLM,但其性能仍優於 17 個月前發布的 Idefics 80B 模型。
模型變體與功能
提供兩種模型大小,每種都有基礎模型和指令微調版本:
- SmolVLM-256M:目前可用的最小 VLM,能夠進行圖像和短視頻字幕生成、文件問答(PDF 和掃描文字),以及涉及圖表和圖表的基本視覺推理。
- SmolVLM-500M:一個五億參數的模型,提供更高的性能空間和對提示的更強穩健性,使其更適合即插即用的生產環境。該模型在 MMMU 和 DocVQA 上的性能接近更大型模型。
與 SmolVLM 2B 的技術改進
Hugging Face 實施了多種設計權衡和優化,以在保持多模態性能的同時減少模型規模:
視覺編碼器優化
與 SmolVLM 2B 所使用的 SigLIP 400M SO 編碼器不同,這些模型使用 SigLIP base patch-16/512 (93M 參數)。測試顯示,較大的編碼器僅帶來微小的收益。較小的編碼器亦能以更高的以更高的解析度處理圖像,這在幾乎無額外開銷的情況下提升了視覺理解。
數據混合更新
訓練數據來源於 The Cauldron 與 Docmatix,並加入 MathWriting。數據比例已調整以強調:
- 文件理解:41%
- 圖像字幕:14%
分詞增強
為提高效率,模型現在將圖像編碼為 4096 像素/token,較 2B 版本的 1820 像素/token 有所提升。此外,引入了特殊 token 來替換多 token 字符串的子圖像分隔符(例如將 <row_1_col_1> 到 <row_6_col_6> 映射為單一 token),這提升了訓練穩定性和結果品質。
生態系統與整合
使用 ColSmolVLM 的多模態檢索
團隊使用類似 ColBERT 的檢索架構開發了 ColSmolVLM 256M 與 500M。這些模型提供最先進的多模態檢索速度,其性能可與大小為其 10 倍的模型相媲美,降低了構建可搜索資料庫所需的成本和時間。
使用 SmolDocling 的文件處理
在與 IBM 的合作中,Hugging Face 正將這些模型整合至 Docling。早期結果顯示,256M 模型在文件佈局和表格理解方面非常有效。
部署與框架支援
SmolVLM-256M 與 500M 與現有的 SmolVLM 程式碼相容,並支援以下框架:
- Transformers: 直接載入以進行推理和微調。
- MLX: 已針對 Apple Silicon 進行優化。
- ONNX: 提供檢查點用於 WebGPU 示範和瀏覽器推理。
- TRL: 支持對齊和直接偏好優化(DPO)。