DeepSeek KV 캐시 최적화와 AI 추론 경제의 변화

DeepSeek KV 캐시 최적화, 메모리 사용량 437배 절감

DeepSeek은 긴 컨텍스트 모델을 서비스하는 데 필요한 VRAM을 획기적으로 줄이는 KV(Key-Value) 캐시 최적화 분야에서 일련의 돌파구를 마련했습니다. 최신 버전인 DeepSeek-V4.1-Flash는 글로벌 KV 캐시를 토큰당 890바이트로 줄였으며, 이는 DeepSeek-V1 대비 메모리 사용량을 약 437배 줄인 수치입니다.

이러한 효율성 향상은 단계적인 아키텍처 진화를 통해 달성되었습니다:

  • MLA (Multi-head Latent Attention): 캐시를 약 15배 압축한 초기 돌파구.
  • Compressed Sparse Attention (CSA) 및 Heavily Compressed Attention: 메모리 사용량을 추가로 줄인 후속 최적화.
  • CSA2, 계층 간 캐시 재사용 및 FP4 캐싱: V4.1-Flash에 추가된 최신 기술로, 인과적 인코더-디코더 아키텍처와 결합하여 메모리 요구 사항을 현재의 토큰당 890바이트까지 낮췄습니다.

코딩과 같은 긴 컨텍스트 활용 사례에서 이러한 최적화는 매우 중요한데, VRAM 용량이 추론 비용의 주요 요인 중 하나이기 때문입니다.

서구권 AI 모델 가격 책정에 미치는 영향

서구권 AI 연구소들이 추론 마진을 개선하고 소비자 가격을 낮추기 위해 이러한 중국 주도의 최적화 기술을 채택하고 있다는 강력한 증거가 있습니다. 이는 최근 모델 출시에서 캐시 읽기 작업의 가격이 급격히 하락한 것에서 잘 드러납니다:

  • Anthropic Opus 5.5: Opus 5 대비 캐시 읽기 가격 60% 인하.
  • OpenAI GPT-6.1 Sol: GPT-5.6 Sol(7월 말 가격) 대비 캐시 읽기 가격 80% 인하.

이러한 가격 변화는 OpenAI와 Anthropic이 중국 연구소들이 공유한 KV 캐시 최적화 기술을 구현함으로써 긴 컨텍스트 윈도우를 서비스하는 비용을 크게 낮췄음을 시사합니다. 원문 작성자는 Claude Opus 5.5와 GPT-6.1 Sol이 조용히, 별다른 발표 없이 출시된 점이 이러한 외부 돌파구에 대한 의존을 부끄러워하는 것일 수 있다고 지적합니다.

AI '경쟁'에 대한 전략적 분석

GPU 제약의 역할

고성능 GPU에 대한 미국의 수출 통제가 의도치 않게 중국 연구소들이 추론 효율성을 우선시하도록 자극했다는 분석이 지배적입니다. 서구권 연구소와 같은 하드웨어 풍요를 누리지 못했기 때문에, 중국 연구자들은 제한된 하드웨어에서 성능을 극대화하기 위한 아키텍처 최적화에 집중했고, 그 결과가 현재 전 세계적으로 채택되고 있는 돌파구들입니다.

전략으로서의 상품화

업계 관측통들은 중국 연구소들이 이러한 기술을 공개적으로 공유하는 것이 거대언어모델(LLM)을 상품화하려는 전략적 움직임이라고 보고 있습니다. 고효율 추론을 누구나 접근 가능하게 함으로써 다음과 같은 효과를 노리는 것으로 보입니다:

  1. 독점적 연구소의 해자 침식: 진입 장벽과 배포 비용을 낮춤으로써 특정 미국 연구소가 효율적인 추론 시장을 독점하지 못하게 합니다.
  2. 제조업 보완: 중국이 글로벌 제조업을 장악하고 있는 만큼, 제조업을 보완하는 소프트웨어(LLM)를 상품화하는 것은 실물 경제에 전략적 이점을 제공합니다.
  3. 빠른 반복 강제: 최적화 기술을 공개함으로써 선도 연구소들이 새로운 모델을 훈련하고 개발하는 데 자원을 쏟게 만들고, 이는 다시 다른 이들에 의해 증류되거나 최적화될 수 있습니다.

반론 및 회의론

모든 관측통이 서구권 연구소들이 단순히 이러한 기술을 '베끼고' 있다고 동의하는 것은 아닙니다. 일부는 다음과 같이 주장합니다:

  • 병렬적 발견: 선도적인 미국 연구소들은 내부적으로 유사한 최적화를 독립적으로 발견할 역량을 갖추고 있을 가능성이 높습니다.
  • 증거 부족: 가격 하락이 최적화와 상관관계가 있기는 하지만, GPT-6.1 Sol이나 Opus 5.5가 구체적으로 DeepSeek의 MLA나 CSA 아키텍처를 사용한다는 직접적인 기술적 확인은 없습니다.
  • 연구 관행: 돌파구를 공유하는 것은 표준적인 학술 및 연구 관행이며, 현재의 '군비 경쟁' 프레임은 과학적 현실보다는 기업의 이익에 의해 주도되는 서사일 뿐입니다.

"전체적인 부양 서사는 '그들의 수익이 얼마나 성장하는지 보라! 1년도 안 되어 ARR 100억 달러에서 1,000억 달러로!'였지만... 그 수익은 단지 추론 비용이 비쌌기 때문이었습니다. 만약 수익이 1,000억 달러에서 500억 달러로 떨어진다면, 비록 이제 수익성이 확보되었다 하더라도 OpenAI와 Anthropic에게는 매우 나쁜 이미지이며, 이는 성장 서사를 완전히 파괴하는 것입니다."

이는 효율성 향상이 마진을 높일 수는 있지만, 역설적으로 비싼 추론 비용에서 발생하는 매출을 줄임으로써 높은 가치 평가를 받는 IPO에 필요한 '성장 스토리'를 해칠 수 있음을 시사합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch