DeepSeek-V4 릴리스 노트: AI 에이전트를 위한 효율적인 1M-토큰 컨텍스트
DeepSeek-V4 릴리스 노트: AI 에이전트를 위한 효율적인 1M-토큰 컨텍스트
DeepSeek은 장기 에이전트 워크로드의 효율성 병목 현상을 해결하기 위해 설계된 Mixture-of-Experts (MoE) 모델 시리즈인 DeepSeek-V4를 출시했습니다. 일반적인 벤치마크는 경쟁력이 있지만, 주요 혁신은 KV 캐시 메모리와 추론 FLOPs를 크게 줄이는 새로운 주의 아키텍처에 있으며,これにより 에이전트에 대해 1M-토큰 컨텍스트가 계산적으로 가능해집니다.
하이브리드 주의를 통한 효율적인 장거리 컨텍스트 추론
DeepSeek-V4는 압축 희소 주의(CSA)와 heavily 압축 주의(HCA)라는 두 개의 interleaved 메커니즘으로 주의를 나누어 1M-토큰 컨텍스트 윈도우를 달성합니다. 이 아키텍처는 bfloat16에서 8개의 헤드를 가진 표준 그룹 쿼리 주의(GQA)에 필요한 KV 캐시 크기의 약 2%로 줄입니다.
압축 희소 주의 (CSA)
CSA는 학습된 위치 편향을 가진 소프트맥스 게이트 풀링을 사용하여 시퀀스 차원을 따라 KV 엔트리를 4배 압축합니다. 성능을 유지하기 위해 "라이트닝 인덱서"(FP4, ReLU 점수가 매겨진 멀티헤드 도트 곱 사용)를 사용하여 각 쿼리당 상위 k개의 압축 블록을 선택합니다. 슬라이딩 윈도우 브랜치는 가장 최근의 압축되지 않은 토큰을 처리하는 데 사용됩니다.
heavily 압축 주의 (HCA)
HCA는 KV 엔트리에 대해 더 공격적인 128배 압축을 사용합니다. 결과적으로 압축된 시퀀스가 매우 짧기 때문에, 모델은 희소 선택 없이 모든 압축 블록에 대해 밀집 주의를 사용할 수 있습니다. CSA와 마찬가지로, HCA는 최신성을 위해 슬라이딩 윈도우 브랜치를 포함합니다.
아키텍처 구현
DeepSeek-V4-Pro 모델(61층)에서 층 0–1은 HCA를 사용하며, 층 2–60은 CSA와 HCA를 교대로 사용합니다. 최종 MTP 블록은 슬라이딩 윈도우 주의만 사용합니다. 메모리를 추가로 줄이기 위해 모델은 대부분의 KV 엔트리에 FP8 저장소를 사용하고 CSA 라이트닝 인덱서에 FP4를 사용합니다.
에이전트 특화 최적화 및 인프라
주의 메커니즘 외에도, DeepSeek-V4는 다단계 도구 사용 중 AI 에이전트의 신뢰성과 일관성을 향상시키기 위해 세 가지 특정 설계 선택을 포함합니다.
도구 호출 전반에 걸친 인터리브드 사고
이전 버전은 새로운 사용자 메시지를 받을 때 reasoning traces를 플러시했지만, V4는 도구 호출이 관련된 경우 사용자 메시지 경계를 넘어 reasoning 내용을 보존합니다.これにより 모델은 장기 과제에 걸쳐 누적 사고 사슬을 유지할 수 있지만, 비도구 대화형 사용 시 컨텍스트를 절약하기 위해 reasoning을 플러시하는 표준 동작은 유지됩니다.
전용 도구-호출 스키마
JSON-in-string 형식에서 흔히 발생하는 파싱 오류와 이스케이프 실패를 줄이기 위해 V4는 다음을 도입합니다:
- 특수
|DSML|토큰. - XML 기반 도구-호출 형식.
- 문자열 매개변수(`string="true