DeepSeek-V4-Flash-0731-Latent-Reasoning 릴리스 노트
DeepSeek-V4-Flash-0731-Latent-Reasoning은 "thinking" 프로세스를 잠재 공간(latent space)으로 이동시키는 특화된 모델 구현체입니다. 추론 토큰을 압축하여 텍스트로 출력하는 대신 잠재 형태로 유지함으로써, 모델은 추론 프로세스를 최적화하는 동시에 커스텀 vLLM fork를 통해 프로덕션 수준의 서빙 런타임을 유지합니다.
성능 및 평가
이 모델은 27개의 서브태스크에 걸쳐 BIG-Bench Hard (BBH) cot_zeroshot 벤치마크에서 0.880의 총점(측정 범위 0.94 0.008)을 달성했습니다.
추론 강점 및 약점
- 높은 숙련도: 모델은 다단계 상태 추적(multi-step state tracking)에서 가장 강력한 성능을 보입니다.
tracking_shuffled_objects,boolean_expressions,formal_fallacies, 그리고penguins_in_a_table과 같은 서브태스크는 모두 1.00의 완벽한 점수를 기록했습니다. - 중대한 약점: 모델은 기계적이고 구문 중심적인 작업에서 어려움을 겪습니다.
dyck_languages(괄호 매칭) 서브태스크는 0.26점을 기록하여, 구조화된 구문 처리에서의 실질적인 추론 실패를 나타냈습니다.
기술적 아키텍처
모델은 잠재 추론을 처리하기 위해 변분 압축 헤드(variational compression head)를 사용합니다. 아키텍처는 레이어 35에서 은닉 상태(hidden states)를 추출하고, 이를 ReasoningCompressionHead와 LatentDecoder를 통해 처리한 후, 고정된 NVFP4 DeepSeek-V4-Flash-0731 백본의 잔차 스트림(residual stream)에 결과를 다시 쓰는 방식으로 작동합니다.
구성 요소 사양
- Hidden Size: 4096
- Latent Dimension: 1024
- MLP Dimension: 2048
- Source/Target Layers: 35 / 42
- Activation: SiLU
- Parameters: 헤드와 디코더는 35.7M float32 파라미터를 포함합니다 (~152 MB).
- Stop Head: 추론 단계의 종료를 결정하기 위해 학습된 stop head가 사용됩니다.
배포 및 서빙
DeepSeek-V4가 MoE 전문가를 라우팅하는 방식(일반적으로 prompt_embeds 경로에서 input_ids가 null로 처리됨) 때문에 표준 vLLM으로는 이 모델을 서빙할 수 없으므로, 커스텀 fork가 필요합니다.
필수 인프라
- Hardware: NVFP4 양자화 및 특정 sparse-MLA 커널 경로로 인해 Blackwell-class 하드웨어 (sm120)가 필수적입니다.
- VRAM 요구사항:
- 긴 컨텍스트(256k)를 위해 ≥ 192 GiB (예: 2× 96 GiB)를 권장합니다.
- 160–192 GiB는 작동 가능하지만
MAX_MODEL_LEN을 32k–64k로 줄여야 합니다. - < 160 GiB는 NVFP4 가중치에 불충분합니다.
서빙 구현
서빙은 ds4-reasoning-addon과 특정 vLLM fork (vllm-ds4-sm120)를 통해 관리됩니다. 시스템은 타겟 위치의 embed_tokens 출력을 덮어씀으로써 디코딩된 잠재 값을 주입하여, hash-MoE 라우팅을 위한 토큰 ID가 정상적으로 흐르게 하면서 cudagraph fast path를 유지합니다.
런타임 구성 및 클라이언트 사용법
필수 클라이언트 요구사항
퇴보적 출력(degenerate output)을 방지하기 위해, 클라이언트는 chat_template_kwargs 또는 특정 헤더를 통해 명시적으로 thinking을 요청해야 합니다:
- 필수 파라미터:
extra_body={"chat_template_kwargs": {"thinking": True}}또는 헤더x-ds4-thinking: 1. - Token Budget: 추론과 답변은 단일 토큰 예산산으로 공유됩니다. 사용자는 잠재 단계가 전체
max_tokens예산을 소모하여 빈 답변이 나오는 것을 방방지하기 위해 높은MIN_OUTPUT_TOKENS(기본값 4096)를 사용해야 합니다.
서버 환경 변수
MAX_LATENT: 잠재 단계의 안전 캡 (기본값 256).MIN_LATENT:
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch