DeepSeek V4 Pro 0813 출시: 성능, 가격 및 벤치마크

DeepSeek V4 Pro 0813은 복잡한 추론 및 과학적 과제를 위해 설계된 고성능 모델로, 최상위 프론티어 모델들에 대한 비용 효율적인 대안을 제공합니다. 대학원 수준의 과학적 추론과 전문적인 에이전트 작업에서 탁월한 성능을 보이지만, 커뮤니티 피드백에 따르면 벤치마크 성능과 실제 코딩 신뢰성 사이에는 격차가 있는 것으로 나타났습니다.

기술적 성능 및 벤치마크

DeepSeek V4 Pro 0813은 고복잡도 추론, 특히 과학 및 대화형 에이전트 시나리오에서 강력한 능력을 보여줍니다. Artificial Analysis의 데이터에 따르면, 이 모델은 다음과 같은 점수를 달성했습니다:

  • Scientific Reasoning: GPQA Diamond (대학원 수준 과학적 추론)에서 88.8%.
  • Conversational Agents: 이중 제어 시나리오에 대한 $\tau^2$-Bench Telecom에서 96.2%.
  • Instruction Following: IFBench에서 76.5%.
  • Long Context Reasoning: AA-LCR에서 70.0%.
  • Coding: SciCode (과학적 컴퓨팅)에서 50.0%, Terminal-Bench Hard에서 46.2%.

하지만 이 모델은 연구 수준의 물리학 추론(CritPt에서 12.9%)에서 상당한 약점을 보이며, 낮은 비환각률(AA-Omniscience에서 5.9%)을 보여 특정 지식 영역에서 추측성 답변을 내놓는 경향이 있음을 시사합니다.

가격 및 API 경제학

DeepSeek V4 Pro 0813은 매우 공격적인 가치 제안을 목표로 하며, 사용자들은 이 모델이 성능 면에서 경쟁력을 유지하면서도 Opus 4.8과 같은 경쟁사보다 약 20배 저렴하다고 평가합니다.

OpenRouter 가격

OpenRouter에서 이 모델의 가중 평균 비용은 다음과 같습니다:

  • Input Price: $0.03942 / M tokens
  • Output Price: $0.8697 / M tokens

공식 DeepSeek 가격 구조

DeepSeek는 부하 및 비용 최적화를 위해 2026년 8월 16일부터 시행되는 피크/오프피크(peak/off-peak) 가격 모델을 도입하고 있습니다:

모델 기간 Cache Hit (Input/1M) Cache Miss (Input/1M) Output (/1M)
V4-Flash Off-peak $0.007 $0.22 $0.66
V4-Flash Peak $0.014 $0.44 $1.32
V4-Pro Off-peak $0.022 $0.66 $1.98
V4-Pro Peak $0.044 $1.32 $3.96

피크 시간대는 01:00–04:00 UTC 및 06:00–10:00 UTC로 정의됩니다.

사용자 인사이트 및 실제 적용

커뮤니티 피드백에 따르면 모델의 벤치마크 성공과 소프트웨어 개발에서의 실제 유용성 사이에 차이가 있음이 드러났습니다.

코딩 및 신뢰성

여러 개발자들은 이 모델이 다른 프론티어 모델들에 비해 복잡한 다중 파일 저장소 작업에서 어려움을 겪고 있다고 보고합니다. 한 사용자는 모델이 단순한 프로젝트에는 유용하지만, GPT-5.6-Terra와 같은 다른 모델들이 완벽하게 수행하는 복잡한 배포 시나리오(예: Caddy를 사용한 Docker-compose)에서는 문제를 일으킨다고 언급했습니다.

또 다른 사용자는 "pass@1" 성능의 신뢰성 문제를 강조했습니다:

"Deepseek V4 Pro 0813은 내가 테스트해 본 모델 중 가장 신뢰할 수 없는 모델입니다... pass@1 성능이 형편없고 잘못될 가능성이 매우 높으며 대부분의 벤치마크에서 끔찍한 결과를 보여줍니다."

V4 Flash와의 비교

V4 Flash 0731 모델이 일반적인 개발 작업에 대해 더 나은 가치와 일관된 결과를 제공한다는 의견이 반복적으로 나오고 있습니다. 사용자들은 Flash를 프로토타이핑 및 대화형 아키텍처 작업에 충분한 "능력의 엄청난 도약"이라고 설명하며, 이로 인해 일부 워크플로우에서는 Pro로의 업그레이드가 미미하거나 심지어 실망스럽게 느껴진다고 말합니다.

특화된 사용 사례

코딩에 대한 비판에도 불구하고, 이 모델은 연구 및 재무 분석 분야에서 찬사를 받고 있습니다. 한 사용자는 주식 시장 및 외환 검색에 있어 이 모델이 "가장 비싼 모델들과 정면 승부를 펼친다"고 보고했으며, 또 다른 사용자는 분산 물리 엔진 시뮬레이터에서 유의미한 이득을 찾는 데 이 모델을 성공적으로 사용했습니다.

운영 지표

OpenRouter를 통해 모델을 통합하는 개발자를 위한 현재 운영 기준은 다음과 같습니다:

  • Throughput: 초당 58 토큰 (P50).
  • Latency: 1.24초 (P50).
  • Uptime: 지난 3일 동안 100%.
  • 개인정보 보호 참고 사항: 일부 사용자는 현재 사용 가능한 엔드포인트에서 개인정보 설정의 "Allow paid endpoints that train on request data"를 활성화해야 할 수도 있다고 언급했습니다.

Sources

관련