SmolVLM2: 讓每台設備都能理解影片

Hugging Face 已推出 SmolVLM2,這是一系列高效的多模態模型,旨在將影像和影片理解帶到本地設備。透過發布三種規模的模型——2.2B、500M 和 256M 參數——SmolVLM2 使得在從行動電話到伺服器的硬體上進行高效能視覺分析成為可能,無需龐大的運算資源。

模型變體與效能

SmolVLM2 提供三種不同的模型大小,以平衡效能與記憶體消耗;其中 500M 和 256M 版本代表目前發布的最小影片語言模型。

SmolVLM2 2.2B

2.2B 模型是通用視覺與影片任務的主要選擇。它在以下幾個關鍵領域相較於先前的 SmolVLM 家族展現顯著提升:

  • 數學推理: 透過圖像解決數學問題的能力增強。
  • OCR 與圖表: 在照片中讀取文字的能力提升,並能理解複雜圖表。
  • 科學問答: 在科學視覺問題上的表現更佳。

在 Video-MME 基準測試中,2.2B 模型在 2B 參數範圍內的表現優於所有現有模型。其記憶體效率使其能在 Google Colab 的免費層級上運行。

SmolVLM2 500M and 256M

500M 模型在參數僅使用不到四分之一的情況下,提供與 2.2B 模型非常接近的影片理解能力。256M 模型是一個實驗性發布,旨在挑戰影片可執行模型能有多小的極限,作為專門微調與創意應用的基礎。

實際應用與示範

為了展示小規模影片模型的實用性,Hugging Face 開發了三個具體應用:

  • iPhone 影片理解: 使用 500M 模型的本地應用程式,可在不需要雲端連線的情況下直接在設備上分析影片內容。
  • VLC 媒體播放器整合: 與 VLC 合作,使得在影片內進行語義搜尋與導航成為可能,使用戶能根據自然語言描述跳至特定章節。
  • 影片亮點生成器: 能處理長格式影片(超過一小時),例如足球比賽,自動提取最重要時刻的工具。

技術實作與部署

SmolVLM2 已與 transformers 函式庫以及用於 Apple Silicon 最佳化的 MLX 整合,從發布起即可使用。

Transformers 整合

推論透過使用聊天模板的對話式 API 進行處理。模型支援:

  • 視訊推論: 透過傳遞路徑 `{

Sources