zai-org/GLM-V
GLM-4.6V/4.5V/4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
解決的問題
GLM-V 是一系列視覺語言模型 (VLMs),旨在超越基礎的多模態感知,向複雜推理、長上下文理解以及作為多模態代理執行任務的能力邁進。它解決了「看到圖像」與「基於視覺數據執行特定動作或解決複雜問題」之間的鴻溝。
工作原理
該專案提供具有不同能力的數個模型版本 (GLM-4.6V, GLM-4.5V, 和 GLM-4.1V):
- GLM-4.6V 整合了原生函數調用,允許模型根據視覺輸入(如螢幕截圖)使用工具並生成圖文交錯的內容。
- GLM-4.5V 專注於現實世界的可用性,透過「思考模式 (Thinking Mode)」開關在圖像、影片和文件理解的效率與深度推理之間取得平衡。
- GLM-4.1V-9B-Thinking 使用課程採樣強化學習 (RLCS) 和思維鏈 (Chain-of-Thought) 推理機制,在較小的參數規模下提高準確性與可解釋性。
適用對象
- 開發者:正在構建多模態代理或 GUI 自動化工具的開發者。
- 研究人員:正在探索視覺語言推理與視覺語言模型強化學習的研究人員。
- 企業用戶:需要高性能文件解析、UI 轉程式碼複製以及視覺定位的企業用戶。
亮點
- 原生多模態函數調用:透過將圖像直接作為工具輸入,連接感知與執行。
- 視覺定位:能夠識別並為自然語言描述的物件提供精確的邊界框。
- UI-to-Code:能夠從 UI 截圖重建像素級精確的 HTML/CSS。
- 長上下文支援:GLM-4.6V 支援高達 128K token 的多文件或長文件理解。
- 靈活部署:相容於 SGLang, vLLM 與 Transformers。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- 專案