Qwen3-VL 릴리스 노트
Ollama는 클라우드 플랫폼에서 Qwen3-VL을 사용할 수 있다고 발표했으며, 향후 릴리스를 통해 로컬 사용 가능 여부도 계획하고 있습니다. Qwen3-VL은 Qwen 시리즈 중 가장 강력한 비전 언어 모델로, 고차원 시각적 인식과 고급 추론 및 에이전트 기능을 통합하도록 설계되었습니다.
고급 시각 및 에이전트 기능
Qwen3-VL은 요소를 인식하고, 기능을 이해하며, 작업을 완료하기 위해 도구를 호출함으로써 PC 및 모바일 GUI를 조작할 수 있는 시각적 에이전트로 작동합니다. 또한 이미지나 비디오에서 HTML, CSS, JS, Draw.io 파일을 직접 생성할 수 있는 "Visual Coding Boost"를 제공합니다.
공간 인지 및 그라운딩
이 모델은 객체의 위치, 관점, 가려짐을 판단할 수 있는 고급 공간 인지 기능을 특징으로 합니다. 이는 더 강력한 2D 그라운딩을 제공하며, 공간 추론 및 embodied AI 애플리케이션에 필수적인 3D 그라운딩 기능을 도입합니다.
멀티모달 추론 및 인식
Qwen3-VL은 STEM 및 수학 분야에서 탁월하며, 인과 관계 분석 및 증거 기반의 논리적 답변을 제공합니다. 시각적 인식 기능은 더 넓고 고품질의 사전 학습을 통해 업그레이드되어, 랜드마크, 동식물, 유명인, 제품 등 더 다양한 객체를 식별할 수 있습니다.
문서 이해 및 긴 컨텍스트
Qwen3-VL은 원활한 텍스트-비전 융합을 제공하여, 텍스트 이해 능력이 순수 대규모 언어 모델(LLM)과 대등한 수준을 유지하도록 보장합니다.
확장된 OCR 및 구조 파싱
모델의 광학 문자 인식(OCR) 기능이 기존 19개 언어에서 32개 언어로 확장되었습니다. 흐릿함, 기울어짐, 저조도 환경에서도 견고하게 작동하도록 설계되었으며, 전문 용어 및 희귀하거나 고대 문자에 대해 개선된 성능을 보여줍니다. 또한, 모델은 긴 문서의 구조를 파싱하는 능력을 향상시켰습니다.
비디오 및 긴 컨텍스트 처리
Qwen3-VL은 256K 토큰의 네이티브 컨텍스트 창을 특징으로 하며, 이는 1M 토큰까지 확장 가능합니다. 이를 통해 모델은 몇 시간 길이의 비디오와 책 전체를 초 단위 인덱싱 및 전체 회상 기능을 통해 처리할 수 있습니다.
배포 및 통합
Qwen3-VL은 현재 Ollama의 클라우드 서비스를 통해 사용할 수 있습니다. 사용자는 다음 방법을 사용하여 모델의 235B 파라미터 버전을 사용할 수 있습니다:
명령줄 인터페이스 (CLI)
사용자는 다음 명령어를 사용하여 모델을 직접 실행할 수 있습니다:
ollama run qwen3-vl:235b-cloud
소프트웨어 라이브러리
Ollama는 통합을 위한 공식 JavaScript 및 Python 라이브러리를 제공합니다. 두 라이브러리 모두 비스트리밍 및 스트리밍 출력을 지원합니다. 예를 들어, Python 라이브러리를 사용하여 모델을 가져오고 다음과 같이 채팅할 수 있습니다:
from ollama import chat
response = chat(
model='qwen3-vl:235b-cloud',
messages=[{
'role': 'user',
'content': 'What is this?',
'images': ['./image.jpg']
}],
)
print(response.message.content)
API 액세스
모델은 Ollama 클라우드 API 및 OpenAI 호환 API를 통해 액세스할 수 있습니다. OpenAI 호환 엔드포인트는 https://ollama.com/v1을 기본 URL로 사용하여 chat completions, completions, 및 embeddings를 지원합니다.
Sources
- OriginalQwen3-VL
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch