DeepSeek-V4.1-Flash 릴리스 노트
DeepSeek-V4.1-Flash는 더 높은 처리량, 빠른 추론 및 네이티브 시각적 이해를 위해 설계된 다중 모달 Mixture-of-Experts (MoE) 모델입니다. 비대칭 아키텍처를 도입하여 이전 플래그십 모델인 DeepSeek-V4-Pro를 능가하면서 운영 비용을 줄였습니다.
비대칭 아키텍처와 모델 지능
DeepSeek-V4.1-Flash는 새로운 Causal Encoder-Decoder 아키텍처를 사용하는 552B 매개변수 MoE 구조를 활용합니다. 이 설계는 입력 처리에 8B 활성 매개변수만, 출력 생성에 16B 활성 매개변수만 사용함으로써 자원 할당을 최적화합니다.
지능적 성능 향상은 새로운 사전 훈련 방법과 대규모 강화 학습(RL) 후 훈련의 조합에 의해 이뤄집니다. DeepSeek에 따르면, 이러한 개선으로 인해 V4.1-Flash는 DeepSeek-V4-Pro 플래그십 모델을 능가하는 벤치마크 성능을 달성할 수 있습니다.
KV 캐시 최적화 및 비용 절감
DeepSeek-V4.1-Flash는 이전 세대 대비 키-값(KV) 캐시의 메모리 및 저장 요구량을 크게 줄였습니다. 모델은 다음과 같은 요구량을 필요로 합니다:
- 이전에 필요했던 고대역폭 메모리(HBM)의 1/4
- 이전에 필요했던 SSD 저장 공간의 1/8
이러한 KV 캐시 압축은 캐시 히트 비용과 관련된 비용을 줄이기 위해 특별히 타겟팅되었습니다. DeepSeek는 이 비용이 에이전트 기반 운영 비용의 대부분을 차지한다고 지적합니다.
API 통합 및 모델 라이프사이클
DeepSeek-V4.1-Flash는 이제 deepseek-flash 모델 식별자로 DeepSeek API를 통해 사용 가능합니다. 릴리스에는 다음 라이프사이클 변경 사항이 포함되어 있습니다:
- 폐기: V4-Flash 및 V4-Flash-Vision-Exp는 이제 폐기되었습니다.
- 호환성:
deepseek-v4-flash및deepseek-v4-flash-vision-exp로 보낸 요청은 일시적으로 V4.1-Flash로 라우팅됩니다. - V4-Pro 전환: DeepSeek는 V4-Pro를 점진적으로 폐기하고 있습니다. 2026년 9월 14일 04:00 UTC부터 모든
deepseek-v4-pro요청은 V4.1-Flash 가격으로 V4.1-Flash로 라우팅되며, V4.1-Pro 출시까지 유지됩니다.
공식 파트너인 WorkBuddy(코드버디 포함) 및 OpenCode는 이제 V4.1-Flash에 대한 완전한 지원을 제공합니다.
가격 및 배포
DeepSeek는 V4.1-Flash 아키텍처의 효율성에 기반하여 2026년 9월 10일 04:00 UTC부터 새로운 가격 정책을 시행합니다. 가격 모델은 피크 및 비피크 요금을 계속 사용하며, 비피크 요금은 피크 요금의 50%로 설정되어 수요 균형을 맞춥니다.
오픈소스 배포를 위해서는 모델과 기술 보고서가 허깅페이스에 제공됩니다. DeepSeek는 2,000개의 GPU와 스토리지 클러스터를 필요로 하는 대규모 배포를 위한 컨설팅도 제공하고 있습니다.