zai-org/GLM-V

GLM-4.6V/4.5V/4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

解決的問題

GLM-V 是一系列視覺語言模型 (VLMs),旨在超越基礎的多模態感知,向複雜推理、長上下文理解以及作為多模態代理執行任務的能力邁進。它解決了「看到圖像」與「基於視覺數據執行特定動作或解決複雜問題」之間的鴻溝。

工作原理

該專案提供具有不同能力的數個模型版本 (GLM-4.6V, GLM-4.5V, 和 GLM-4.1V):

  • GLM-4.6V 整合了原生函數調用,允許模型根據視覺輸入(如螢幕截圖)使用工具並生成圖文交錯的內容。
  • GLM-4.5V 專注於現實世界的可用性,透過「思考模式 (Thinking Mode)」開關在圖像、影片和文件理解的效率與深度推理之間取得平衡。
  • GLM-4.1V-9B-Thinking 使用課程採樣強化學習 (RLCS) 和思維鏈 (Chain-of-Thought) 推理機制,在較小的參數規模下提高準確性與可解釋性。

適用對象

  • 開發者:正在構建多模態代理或 GUI 自動化工具的開發者。
  • 研究人員:正在探索視覺語言推理與視覺語言模型強化學習的研究人員。
  • 企業用戶:需要高性能文件解析、UI 轉程式碼複製以及視覺定位的企業用戶。

亮點

  • 原生多模態函數調用:透過將圖像直接作為工具輸入,連接感知與執行。
  • 視覺定位:能夠識別並為自然語言描述的物件提供精確的邊界框。
  • UI-to-Code:能夠從 UI 截圖重建像素級精確的 HTML/CSS。
  • 長上下文支援:GLM-4.6V 支援高達 128K token 的多文件或長文件理解。
  • 靈活部署:相容於 SGLang, vLLM 與 Transformers。

相關

  • 專案
  • Dispatch
  • 專案
  • Dispatch
  • 專案