DeepSeek-V3.2-Exp 릴리스 노트

DeepSeek는 긴 문맥 성능을 최적화하고 운영 비용을 절감하기 위해 설계된 실험적 모델인 DeepSeek-V3.2-Exp를 출시했습니다. 이번 릴리스에는 이전 모델인 V3.1-Terminus의 출력 품질을 유지하면서 더 빠른 학습 및 추론을 가능이 하는 메커니즘인 DeepSeek Sparse Attention (DSA)가 도입되었습니다.

DeepSeek Sparse Attention (DSA) 및 효율성

DeepSeek Sparse Attention (DSA)는 긴 문맥 처리 중 계산 비용을 줄이고 성능을 높이기 위해 세밀한 희소 주의(fine-grained sparse attention)를 구현합니다. DeepSeek에 따르면, DSA는 출력 품질에 미치는 영향을 최소화하면서 이러한 효율성 이득을 달성합니다. 벤치마크 결과에 따르면 DeepSeek-V3.2-Exp는 V3.1-Terminus와 대등한 성능을 보여줍니다.

API 가격 및 가용성

DeepSeek는 즉시 적용되는 API 가격을 50% 이상 인하했습니다. 새로운 모델은 DeepSeek App, Web 인터페이스 및 API를 통해 사용할 수 있습니다. 비교 테스트를 용이하게 하기 위해, V3.1-Terminus 모델은 2025년 10월 15일 15:59 UTC까지 임시 API를 통해 계속 제공됩니다.

오픈 소스 및 기술 리소스

DeepSeek-V3.2-Exp는 오픈 소스로 출시되었습니다. 회사는 개발자와 연구자를 위해 다음과 같은 리소스를 제공합니다:

  • Model Weights: Hugging Face에서 사용할 수 있습니다.
  • Technical Report: 상세 문서는 GitHub에 호스팅되어 있습니다.
  • GPU Kernels: 주요 GPU 커널은 TileLang 및 CUDA에서 제공되며, 빠른 연구 프로토타이핑을 위해 TileLang을 권장합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch