Hugging Face 視覺語言模型 2025 更新
Vision Language Models (VLMs) 已從簡單的圖像到文字系統演變為多功能的多模態代理,能夠進行複雜推理、任意到任意模態生成,以及與物理世界互動。當前的格局以向更小、更高效模型的轉變、Mixture-of-Experts (MoE) 解碼器的整合,以及多模態 RAG 與機器人控制等專門能力的出現為特徵。
新興模型架構與趨勢
VLM 最近的發展引入了多種新架構範式,擴展了多模態 AI 的範圍。
任意到任意模型
任意到任意模型能處理任何輸入模態(圖像、文字、音訊),並生成任何輸出模態。這些模型使用多個編碼器將嵌入融合到共享的表示空間,然後解碼為所需的模態。值得注意的例子包括:
- Qwen 2.5 Omni:採用「Thinker-Talker」架構,其中「Thinker」負責文字,而「Talker」產生串流自然語音。
- MiniCPM-o 2.6:一個 8B 參數的模型,能夠理解並生成視覺、語音與語言內容。
- Janus-Pro-7B:具備解耦的視覺編碼架構,以分離理解與生成過程。
- Chameleon (Meta):早期的任意到任意能力嘗試,後由 Alpha-VLLM 的 Lumina-mGPT 擴展至包含圖像生成。
多模態推理模型
推理模型旨在透過長鏈思考處理來解決複雜問題。Kimi-VL-A3B-Thinking 是一個顯著的例子,使用 MoonViT 圖像編碼器與 Mixture-of-Experts (MoE) 解碼器(總參數 16B,活躍 2.8B)。它是基於 Kimi-VL 基礎模型的長鏈思考微調與強化學習對齊版本。
小型且高效的 VLM
越來越多的趨勢是朝向「Smol」模型(通常低於 2B 參數)以降低計算成本,並在消費者設備上本地執行。
- SmolVLM2:專注於影片理解,規模分別為 256M、500M 與 2.2B 參數。
- Gemma 3-4B-it:最小的多模態模型之一,具備 128k 令牌上下文窗口,支援超過 140 種語言。
- Qwen2.5-VL-3B-Instruct:具備本地化、文件理解與代理任務能力,擁有 32k 令牌上下文長度。
Mixture-of-Experts (MoE) 解碼器
MoE 架構以路由器取代標準的前饋網路 (FFN) 層,僅選擇性啟動最相關的「專家」。與密集模型相比,這可帶來更快的推論與更快的訓練收斂,儘管需要更多 GPU 記憶體。例子包括 Kimi-VL、MoE-LLaVA、DeepSeek-VL2 與 Llama 4。
Vision-Language-Action (VLA) 模型
VLA 透過加入動作與狀態標記,擴展 VLM,使模型能控制實體環境或數位 UI。
- π0 and π0-FAST:在 7 個平台與 68 項任務(如摺衣、物件檢索)上訓練的機器人基礎模型。
- GR00T N1 (NVIDIA):一個 2B 的類人機器人基礎模型,將圖像與語言轉換為即時運動控制。
專門的多模態能力
本地化:偵測、分割與計數
VLM 現在透過輸出帶有本地化標記的結構化文字,將傳統電腦視覺任務概括化。
- PaliGemma and PaliGemma 2:使用任務前綴(例如「segment striped cat」)輸出邊界框座標或分割遮罩的碼本索引。
- Molmo:能以點指向實例並計算物件數量。
- Qwen2.5-VL:支援偵測、指向與計數,包括 UI 元素。
多模態安全模型
為防止 jailbreak 與有害輸出,多模態安全模型會過濾輸入與輸出。
- ShieldGemma 2:一個開放的安全模型,根據特定內容政策評估圖像。
- Llama Guard 4:從 Llama 4 Scout 剪枝而來的密集多模態與多語言安全模型。
多模態檢索增強生成 (RAG)
多模態 RAG 透過使用多模態檢索器直接從螢幕截圖中辨識相關頁面,繞過脆弱的 PDF 解析。
- Document Screenshot Embedding (DSE):使用文字與圖像編碼器,為每段返回單一向量。
- ColBERT-like models (e.g., ColPali, ColQwen2):使用 VLM 作為圖像編碼器,LLM 作為文字編碼器,利用「MaxSim」計算文字標記與圖像補丁之間的相似度,以提升精度。
多模態代理與影片理解
GUI 與數位代理
VLM 越來越多用於電腦與手機操作。UI-TARS-1.5(ByteDance)與 MAGMA-8B 設計用於 UI 導航與實體互動。Hugging Face 的 smolagents 函式庫現在支援 VLM 整合,允許代理接收初始圖像或透過回呼動態取得螢幕截圖,以即時控制 GUI。
影片語言模型
影片理解透過將影片視為影格序列來處理,並採用各種策略管理時間關係:
- LongVU (Meta):使用 DINOv2 降採樣影格以去除相似影格,並根據文字查詢精練集合。
- Qwen2.5-VL:使用擴展的多模態 RoPE 以理解絕對時間位置並處理動態 FPS 速率。
- Gemma 3:接受在文字提示中交錯時間戳記的影片影格。
對齊與評估
偏好最佳化
直接偏好最佳化(DPO)正被應用於 VLM,以使用「chosen」與「rejected」答案對將模型回應對齊至人類偏好。RLAIF-V 資料集提供超過 83,000 筆標註樣本,trl 函式庫提供 DPOTrainer 以實作此工作流程。
進階基準測試
隨著模型在舊基準測試上飽和,新的工具出現以評估專家級知識與推理:
- MMT-Bench:包含 31,325 題多選題,跨 32 個元任務(OCR、視覺辨識等),使用圖像、文字、影片與點雲模態。
- MMMU-Pro:MMMU 的進化版,將候選選項從 4 增至 10,並加入僅視覺輸入與實境模擬,以模仿實際顯示條件。