zai-org/GLM-V
GLM-4.6V/4.5V/4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
해결하는 문제
GLM-V는 기본적인 멀티모달 인식을 넘어 복잡한 추론, 긴 문맥 이해 및 멀티모달 에이전트로서의 동작을 목표로 설계된 일련의 시각-언어 모델(VLMs)입니다. 이는 이미지를 보는 것과 시각 데이터에 기반하여 특정 동작을 실행하거나 복잡한 문제를 해결하는 것 사이의 간극을 해결합니다.
작동 방식
이 프로젝트는 서로 다른 역량을 가진 여러 모델 버전(GLM-4.6V, GLM-4.5V, GLM-4.1V)을 제공합니다:
- GLM-4.6V는 네이티브 함수 호출을 통합하여 모델이 시각적 입력(스크린샷 등)을 기반으로 도구를 사용하고 이미지와 텍스트가 혼합된 콘텐츠를 생성할 수 있도록 합니다.
- GLM-4.5V는 이미지, 비디오 및 문서 이해에 있어 속도와 심층 추론의 균형을 맞추기 위한 "Thinking Mode" 스위치를 통해 실세계 사용성에 초점을 맞춥니다.
- GLM-4.1V-9B-Thinking은 RLCS(Reinforcement Learning with Curriculum Sampling)와 Chain-of-Thought 추론 메커니즘을 사용하여 더 작은 파라미터 규모에서 정확도와 해석 가능성을 향상시킵니다.
대상 사용자
- 개발자: 멀티모달 에이전트 또는 GUI 자동화 도구를 구축하는 개발자.
- 연구자: VLM을 위한 시각-언어 추론 및 강화 학습을 탐구하는 연구자.
- 기업 사용자: 고성능 문서 파싱, UI-to-code 복제 및 비주얼 그라운딩이 필요한 기업 사용자.
주요 특징
- 네이티브 멀티모달 함수 호출: 이미지를 도구 입력으로 직접 전달하여 인지와 실행을 연결합니다.
- 비주얼 그라운딩: 자연어로 설명된 객체를 식별하고 정확한 바운딩 박스를 제공할 수 있습니다.
- UI-to-Code: UI 스크린샷에서 픽셀 단위로 정확한 HTML/CSS를 재구성할 수 있습니다.
- 긴 문맥 지원: GLM-4.6V는 멀티 문서 또는 긴 문서 이해를 위해 최대 128K 토큰을 지원합니다。
- 유연한 배포: SGLang, vLLM 및 Transformers와 호환됩니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트