LFM2.5-VL-3B 發佈說明 / 有什麼新功能
Liquid AI 已宣布推出 LFM2.5-VL-3B,這是一款專為高效能裝置端與邊緣部署設計的視覺語言模型 (VLM)。該模型針對即時應用進行了優化,優先考慮直接回答而非思維鏈 (chain-of-thought) 推理,以維持低延遲。
關鍵能力與改進
LFM2.5-VL-3B 較先前版本引入了四項主要增強功能:
- 螢幕與 UI 理解: 增強了對各種裝置數位螢幕的解讀能力。
- Grounding (定位): 透過自然語言查詢,改進了物件偵測與定位能力。
- 多圖輸入: 在同時處理多張圖像時,具備更好的推理能力。
- Function Calling (函式呼叫): 在純文字與視覺-文字情境下,皆顯著提升了工具使用與函式呼叫的能力。
技術架構與訓練
LFM2.5-VL-3B 是一個 3.1B 參數模型,結合了 SigLIP2 400M NaFlex 視覺編碼器與在 LFM2.5-2.6B 文字模型中使用的預訓練骨幹網路。
訓練數據與流程
- Pre-training (預訓練): 該模型在約 34 兆個 token 上進行了預訓練。這包括比先前版本多出四倍的視覺數據,利用精選與合成數據集進行圖像描述 (image-captioning)、OCR、grounding 與指令遵循 (instruction-following)。
- Tokenizer (分詞器): 為了支援非拉丁文字,詞彙表透過原地分詞器擴展 (in-place tokenizer extension) 擴展至 128K。
- Post-training (後訓練): 訓練流程包含兩個階段:利用從較大教師模型進行知識蒸餾 (knowledge distillation) 的監督式微調 (SFT),以及 Antidoom 訓練,隨後進行多獎勵強化學習 (RL)。
性能基準測試
視覺性能
LFM2.5-VL-3B 在真實世界的圖像任務上領先其同級別模型,並在閱讀數位內容(包括圖表與 UI 元件)方面展現出強大的性能。在比較測試(歸一化 0-100)中,它在視覺基準測試中獲得了 69.4 的平均分數,與 InternVL 3.5 4B (69.4) 和 Qwen3.5-4B (70.1) 表現接近。
值得注意的基準測試結果包括:
- ScreenSpot-v2 (Desktop/Mobile/Web): 較 LFM2-VL-3B 有顯著的性能提升,得分分別為 78.7 (Desktop)、81.2 (Mobile) 與 82.2 (Web)。
- RefCOCO-avg (Grounding): 得分 87.9,較先前版本的 57.1 大幅增加。
- BLINK (Multi-Image): 得分 61.5,超越了數個較大的模型,如 Gemma-4-E4B-it (52.2) 與 Qwen3.5-2B (48.6)。
文字與工具使用性能
在純文字基準測試中,LFM2.5-VL-3B 展現了改進的指令遵循能力 (IFEval: 82.3) 以及工具使用能力的急劇增加。在 ToolSandbox (59.5) 中,其表現與 Gemma-4-E2B (56.5) 及 Qwen3.5-2B (47.7) 相當。
推理速度與硬體相容性
LFM2.5-VL-3B 專為邊緣端設計,僅需約 3 GB 的記憶體。它提供對 llama.cpp、MLX、vLLM、SGLang 與 ONNX 的首日支援。
裝置端基準測試
- M5 Max: 228 tokens/s
- Ryzen AI Max+ 395: 116 tokens/s
- Galaxy S26 Ultra: 20 tokens/s
GPU 吞吐量
在 H100 GPU 上,該模型在高併發情況下可達到約 11K tokens/s 的輸出吞吐量,這大約是 4B 級別模型的兩倍。這使得單張 H100 每天可產出近 10 億個輸出 token。
實作方式
LFM2.5-VL-3B 可於 Hugging Face 上取得,並相容於 transformers>=5.10.1。對於涉及圖像描述、grounding 與 OCR 的任務,可以使用 AutoModelForImageTextToText 與 AutoProcessor 進行載入。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch