토큰이 너무 싸서 측정할 필요가 없게 되다 – 왜 AI 계산 비용은 급격히 하락하고 있는가

토큰 비용은 과거 어떤 추세보다 빠르게 하락하고 있다

지난 12개월 동안 AI 작업 완료 비용이 약 2.5개 주문의 크기만큼 감소했으며, 이는 하드웨어 효율성, 모델 아키텍처, 추론 엔진의 동시적 발전에 기인한다. 이로 인해 토큰의 비용은 너무 낮아져, 외부 도구(예: grep, HTML 파싱, 또는 cargo build)를 호출하는 오버헤드가 워크플로우의 총 비용을 지배하게 될 것이다.


하드웨어 효율성 향상

GPU는 2년마다 효율이 두 배로 증가한다

GPU 에너지 효율(GFLOP/J)의 로그 스케일 플롯은 1.3-로그 기울기를 보이며, 이는 효율이 약 2년마다 두 배로 증가한다는 의미로, 과거 무어의 법칙의 역사적 속도와 유사하다. 이 추세는 초기 소비자 GPU부터 최신 데이터센터 H100에 이르기까지 세대 간에 일관되게 유지된다.

"이러한 효율성 향상은 1960년대 무어의 법칙 이후로 우리가 본 적 없는 수준이다." – 게시자

추론 엔진은 연간 10~50% 향상

오픈소스 엔진인 vLLM은 버전 0.5.4(2024년 9월)에서 0.11.1(2025년 12월) 사이에 **1톤당 줄리 감소율 약 40%**를 달성했다. NVIDIA의 전체 스택 MLPerf 스택은 버전 2.0에서 2.1로 갈수록 최대 50%의 효율성 향상을 보였으며, Intel의 MLPerf 6.1은 6.0 대비 2.4배의 처리량 증가를 보였다.


모델 수준의 비용 절감

작업당 비용은 감소하지만 토큰당 가격은 정체됨

선도 모델은 여전히 유사한 토큰당 가격을 유지하지만, 더 큰 모델은 훨씬 적은 토큰으로 작업을 완료한다. 2025~2026년의 품질 대 비용의 파레토 선은 동일한 벤치마크를 작년보다 100배 더 저렴하게 실행할 수 있음을 보여준다.

믹스처 오브 익스퍼트(MoE)는 계산량을 줄인다

MoE 아키텍처는 불필요할 때 전문가 레이어를 비활성화하여 동일한 벤치마크 성능을 위해 최대 7배 적은 파라미터를 사용할 수 있다. 지역 배포 시 여전히 모든 전문가를 메모리에 로드해야 하지만, 전체적으로 질 대 줄리 비율은 극적으로 향상된다.


전문화된 모델이 추세를 가속화한다

Jev와 Laya는 '무료' 출력 토큰을 달성한다

TypeSafe의 Jev 분류기는 입력 토큰에 대해 $0.042/MTok, 출력 토큰에 대해 $0을 청구한다—약 10억 토큰당 $42, 다섯 권의 책을 읽는 데 드는 비용과 비슷하다. 오픈웨이트인 Laya는 미세조정 시 Jev의 정확도를 따라가거나 초과하며, 설정이 더 복잡하다.

"우리는 이것이 보조금이 아님을 입증할 수 없다; 장기적으로 가격의 지속 가능성을 입증해야 한다(우리는 가격이 오르기보다 내릴 것으로 예상한다)." – TypeSafe 가격 정책 주석


토큰이 도구 호출보다 싸질 때

GPT-5.6 Luna($0.30/M 토큰)과 일반적인 MacBook Air(대기 시 10W, 고부하 시 30W)를 사용한 대략적인 계산 결과는 다음과 같다:

도구 전력 (W) 지속 시간 (초) 비용 (¢) Luna 턴보다 몇 주문 낮은가
grep 10 0.1 0.000007 4.5
HTML 파싱 10 1 0.00007 3.5
cargo build 30 30 0.00625 1.5

현재 비용률을 기준으로, LLM 호출 비용이 간단한 grep보다 낮아질 것이며, 이는 기존 도구 파이프라인 내에 모델을 통합하는 데 경제적으로 매력적이게 된다.


경제적 반작용

공급 측면의 제브온스 역설

더 높은 효율성은 유도 수요를 촉진한다: AI 제공업체는 한 달러당 더 높은 수익을 얻을 수 있기 때문에 더 많은 컴퓨팅 자원에 투자한다. 이는 전기 비용이 낮아지면서 전체 소비가 증가한 고전적인 제브온스 역설과 유사하다.

비즈니스 모델의 지속 가능성

비판자들은 저렴한 토큰만으로는 수익성이 보장되지 않는다고 지적한다. 제공업체는 여전히 선도 모델 프리미엄 가격, 기업 계약, 볼륨 기반 서비스에 의존하고 있다. 오픈웨이트 경쟁은 마진을 압박할 수 있지만, 하드웨어 업체(NVIDIA 등)와 전문화된 추론 서비스는 규모의 경제를 통해 여전히 수익을 얻을 것이다.


미래 시나리오

  1. 일상적인 로컬 추론 – 3~6년 내에 RAM 효율적인 아키텍처(Mamba, 4비트 양자화)와 MoE 확장 덕분에 선도 수준의 모델이 일반 하드웨어에서 실행될 것으로 예상된다.
  2. AI 강화 도구 – 토큰 비용이 도구 호출 비용보다 낮아지면 개발자들은 즉석 스크립트를 모델 기반 보조자로 대체할 것이다(예: jgrep). 빌드 스케줄러, 보안 스캐너, CI 파이프라인은 AI 중심으로 전환될 수 있다.
  3. 소프트웨어 가치의 전환 – 주요 차별 요소는 원시 기능에서 품질, 보안, 통합으로 이동할 것이다. 전환 비용이 높은 기존 SaaS 제품은 이점을 유지할 것이며, 유연하고 AI로 생성된 소프트웨어는 특화된 영역에서 확산될 것이다.

커뮤니티 반응

"토큰이 도구 호출보다 싸질 것이다… 나는 이 시점에서 스텐의 법칙을 언급하고 싶다: '무엇이 영원히 지속될 수 없다면, 결국 멈출 것이다.'" – @jetrink

"가치 판단 없이 파레토 차트는 의미가 없다; '가장 매력적인 사분면'은 독자를 오도한다." – @meatmanek

"에너지 효율 그래프는 여러 추세선에 맞출 수 있다; GPU가 2년마다 두 배로 증가한다는 주장은 더 엄격한 통계적 근거가 필요하다." – @empw

"추론이 계속 상품화된다면, 하드웨어 마진은 줄어들고 수익은 서비스와 특화된 칩으로 이동할 것이다." – @bryanlarsen

이러한 댓글들은 지속 가능한 지수적 추세에 대한 회의, 벤치마크 시각화의 신중한 해석 필요성, 장기적 비즈니스 지속 가능성에 대한 우려를 드러낸다.


핵심 요약

하드웨어 효율성, 모델 아키텍처 발전, 소프트웨어 엔진 최적화의 융합으로 인해 AI 토큰 비용은 단 1년 만에 2개 주문 이상 감소했다. 이는 토큰의 비용이 많은 전통적인 컴퓨팅 원천보다 낮아졌으며, AI가 소프트웨어 도구 및 인프라의 본질에 직접 통합될 미래를 예고한다.

Sources

관련