DeepSeek-V4-Flash-Vision-Exp 릴리스 노트
DeepSeek는 DeepSeek API를 통해 이용 가능한 실험용 다중모달 모델인 DeepSeek-V4-Flash-Vision-Exp을 공개했습니다. 이 모델은 텍스트 기반 추론과 도구 사용에 시각적 이해 능력을 통합할 수 있게 하여, 다중모달 에이전트 성능을 Opus-4.8 수준에 가까운 수준으로 크게 향상시킵니다.
다중모달 성능 및 기능
DeepSeek-V4-Flash-Vision-Exp는 표준 DeepSeek-V4-Flash 모델과 동일한 텍스트 처리 능력을 유지하며, 추론, 세계 지식, 에이전트 기능 등이 포함됩니다. 주요 발전은 다중모달 능력에서 나타나며, 다중모달 에이전트 벤치마크에서 V4-Flash보다 뚜렷한 성능 향상을 보이며 Opus-4.8 수준에 근접한 성능을 달성했습니다.
에이전트 워크플로우 및 시각적 이해
이 모델은 에이전트 프레임워크와 원활하게 작동하도록 설계되었습니다. 다양한 도구와 시각적 이해 능력을 결합함으로써, 시각 데이터를 해석하여 작업을 수행해야 하는 더 현실적이고 복잡한 워크플로우를 가능하게 합니다.
API 통합 및 구현
개발자는 model='deepseek-v4-flash-vision-exp' 식별자를 사용하여 모델에 접근할 수 있습니다. 즉각적인 채택을 지원하기 위해 모델과 함께 DeepSeek Harness 0.1.1이 동시에 출시되었습니다.
입력 및 요금 청구
- 입력 형식: 모델은 텍스트와 이미지의 혼합 입력을 지원합니다. 이미지는 외부 URL, base64 인코딩 또는 Files API를 통해 제공할 수 있습니다.
- 요금 청구: 이미지는 요금 청구를 위해 토큰화되며, 각 이미지는 최대 384토큰을 소비합니다. 이러한 토큰의 가격은 V4-Flash 가격과 동일합니다.
- 지원되는 엔드포인트: 모델은 채팅 완성(Chat Completions), 메시지(Messages), 응답(Responses)을 지원합니다.
Files API 출시
모델 릴리스와 함께 DeepSeek는 무료로 사용 가능한 Files API를 출시했습니다. 이 API를 통해 사용자는 이미지를 한 번 업로드하고 이후 요청에서 file_id를 참조할 수 있습니다. 이 아키텍처는 요청 대역폭을 줄이고, 여러 API 호출 간에 동일한 이미지를 반복적으로 업로드할 필요를 없애줍니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch