DeepSeek V4 Flash 0731는 태스크당 $0.02~$0.04로 ARC‑AGI‑1에서 89%, ARC‑AGI‑2에서 61.4% 달성
개요
DeepSeek V4 Flash 0731은 ARC‑AGI 벤치마크 세트에서 최상위 성능을 발휘하며, ARC‑AGI‑1(Semi‑Private)에서 89.0%, ARC‑AGI‑2(Semi‑Private)에서 61.4%를 기록했습니다. 각각 태스크당 $0.02와 $0.04의 비용으로 이 성능을 달성했으며, 이는 많은 프로프라이어터리 대안보다 추론 비용이 한 단계 낮은 수준입니다.
벤치마크 성능
공식 ARC‑AGI 랭킹에 따르면, DeepSeek V4 Flash 0731은 세 가지 추론 변형을 제공합니다:
| 변형 | ARC‑AGI‑1 | ARC‑AGI‑2 | ARC‑AGI‑3 |
|---|---|---|---|
| Max | 89.0% | 61.4% | — |
| High | 87.0% | 56.0% | — |
| Low | 84.0% | 46.0% | — |
"Max" 변형은 가장 공격적인 추론 설정을 사용하며, 두 벤치마크에서 "High" 및 "Low" 설정보다 뛰어난 성능을 보입니다. 작성 시점 기준으로 모델은 ARC‑AGI‑3 점수를 공개하지 않았습니다.
태스크 수준의 통과/실패 (ARC‑AGI‑2 공개 평가)
120개의 공개 평가 태스크 중, "Max" 변형은 73개를 통과했고, "High"는 71개, "Low"는 58개를 통과했습니다. 상세한 통과/실패 매트릭스는 논리적 추론과 코드 추론 태스크에서 일관된 강점을 보이며, 일부 시각 퍼즐 스타일 태스크는 여전히 도전 과제임을 보여줍니다.
비용 효율성
DeepSeek V4 Flash 0731는 "최대 노력" 가격 체계 하에서 ARC‑AGI‑1 태스크당 $0.02, ARC‑AGI‑2 태스크당 $0.04를 청구합니다. 제공자가 참조하는 캐시 가격 모델을 사용할 경우, 약 1 M 토큰당 $0.02~$0.04로 환산됩니다. 커뮤니티 구성원들은 운영 비용이 거의 없음을 반복적으로 강조합니다:
"저는 Oh My Pi에서 두 번째 인스턴스를 "어드바이저"로 실행하고 있으며, 5~6개의 활성 세션을 가동해도 하루에 5달러를 넘게 쓰기 어렵습니다." – @LaurensBER
"DeepSeek는 API 사용을 위한 저렴하고 즐거운 중국 모델입니다. 더 저렴하고, 이제는 Pro보다 나아졌습니다. 최고는 아니지만, 가격 대비 성능이 그 범위 내의 어떤 모델보다도 뛰어납니다." – @SwellJoe
실제 사용 통찰
속도와 배포 가능성
사용자들은 이 모델이 듀얼‑RTX 6000 Blackwell 시스템에서 ~8 k 토큰/초 프리필, ~250 토큰/초 생성 속도로 작동한다고 보고하며, vLLM을 통해 64개 동시 스트림으로 ~1 k 토큰/초까지 확장됩니다. 이 처리 능력은 느끼는 지연 없이 인터랙티브 채팅을 가능하게 하며, 대규모 에이전트 배포를 지원합니다.
"2x RTX Pro 6000 Blackwell에서 프리필은 ~8k 토큰/초, 단일 스트림에서는 ~250 토큰/초입니다. vLLM에서 약 64개의 동시 스트림으로 1000 토큰/초를 달성했습니다. 이 정도 속도면 기다리며 탭을 전환할 필요 없이 인터랙티브하게 대화할 수 있습니다." – @ak_t
프로그래밍 및 도구 사용
이 모델은 코딩 지원과 도구 호출 능력에서 높은 평가를 받으며, 일상적인 개발 워크플로우에서 더 큰 프로프라이어터리 모델보다 뛰어난 성능을 보입니다.
"프로그래밍 작업에 이 모델을 사용해보는 것을 강력히 추천합니다. Fable만큼 강력하진 않지만 Opus보다 훨씬 더 나은 "성격"을 가지고 있으며, 매우 다른 맹점이 있습니다. 종합적으로 저는 이 모델이 대화 방식 때문에 프로그래밍에 더 선호됩니다." – @mosura
"이 버전의 가장 좋은 점 중 하나는 Codex 허슬에서 훈련된다는 것입니다. Codex 도구 사용 시 OpenAI 모델만큼 자연스럽게 느껴지지만, 매우 저렴하고 1M 컨텍스트를 지원합니다." – @tarruda
저자원 접근성
조정된 GGUF Q8 K XL 변형은 256GB DRAM 서버에 여유롭게 적재되어, GPU가 없는 사용자도 CPU 전용 하드웨어에서 밤새 모델을 실행할 수 있습니다.
"GPU가 전혀 없고, 초당 토큰 수가 느린 워크플로우를 설정하는 데 문제가 없다면, 작업을 주고 4~6시간 후에 다시 확인해보세요. 아주 잘 작동합니다." – @walrus01
성능 주의사항
벤치마크 점수가 인상적이지만, 여러 사용자가 회귀와 에지 케이스 실패를 지적했습니다:
- 무한 루프 및 자기 대화: 일부 사용자는 특정 에이전트와 함께 사용 시 모델이 반복적인 루프에 빠지거나 관련 없는 콘텐츠를 생성하는 문제를 경험했습니다.
- 문장 길이 변화: 최근 업데이트로 토큰 사용량이 증가하고 응답이 더 길어졌으며, 이는 비용과 간결성에 영향을 미칩니다.
- 시각 퍼즐 추론: ARC‑AGI‑2 점수가 뛰어나지만, 멀티모달 입력을 지원하지 않아 시각 퍼즐을 순수 텍스트 추론으로 어떻게 해결하는지에 대한 의문이 제기됩니다.
"무한 루프에 빠지고 도구 호출 없이 자기 자신과 대화하는 문제가 너무 많아서 토큰을 엄청나게 낭비했습니다... 여전히 가치는 있지만, 제 경험상 에이전트 성능은 저하되었습니다." – @nylonstrung
"모델이 훨씬 더 격식 있고 과도하게 설명하는 경향이 생겼습니다. 강력한 프롬프트 재작성이 도움이 되긴 했지만, 아마도 코딩과 ARC‑AGI에서 더 잘하기 위한 대가일지도 모릅니다." – @momojo
커뮤니티 반응
Hacker News에서 전반적인 반응은 매우 긍정적이며, 게시물은 779개의 업보트와 466개의 댓글을 받았습니다. 사용자들은 모델의 가격 대비 성능 비율, 로컬 배포 가능성, 그리고 자동화에 대한 유용성(예: CI 테스트 생성, 로그 모니터링, 소셜미디어 피드 재정렬)을 축하합니다. 소수의 사용자는 불일치하는 동작과 향후 가격 인상 가능성에 실망을 표시했습니다.
"DeepSeek는 가격이 "매우 큰 증가"를 예고하고 있으므로, 이 라인은 곧 오른쪽으로 이동해야 할지도 모릅니다." – @modeless
"Kimi K3는 한 달 전만 해도 흥미로운 모델이었고, 지금은 그 성능을 1/20의 가격에 얻고 있습니다. 얼마나 빠르게 발전하고 있는지 놀랍습니다." – @542458
결론
DeepSeek V4 Flash 0731는 2026년 중반의 고정확도, 저비용 LLM 추론에 새로운 기준을 세웠습니다. 89.0%의 ARC‑AGI‑1 및 61.4%의 ARC‑AGI‑2 점수는 경쟁력 있는 추론 능력을 보여주며, 센트 미만의 태스크당 가격, 빠른 CPU/GPU 처리 속도, 강력한 코딩 지원은 취미 사용자와 기업 에이전트 모두에게 실용적인 선택을 제공합니다. 사용자는 때때로 발생하는 회귀 현상과 향후 가격 변화를 주의 깊게 모니터링해야 하지만, 현재로서는 최첨단 언어 모델 성능에 도달하는 가장 비용 효율적인 경로 중 하나입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch