AI 보조금 시대의 종말: 왜 정액 요금제가 실패하고 있는가

지난 몇 년간 AI 산업은 침묵의 합의 하에 운영되어 왔습니다: "AI 보조금 시대). 기업들은 제품의 모든 계층에 생성형 AI 기능을 통합했으며, 추론 비용이 충분히 빠르게 떨어져 정액 구독이 지속 가능할 것이라고 베팅했습니다.

그러나 최근 시장 신호는 이 베팅이 실패하고 있음을 시사합니다. Microsoft가 내부 Claude Code 라이선스를 취소하는 것부터 Uber가 단 4개월 만에 2026년 AI 예산을 소진하는 것까지, 산업은 벽에 부딪히고 있습니다. 비용 곡선은 제공자에게 유리하게 굽혀지지 않고, 오히려 반대 방향으로 굽혀지고 있습니다.

선형 외삽의 오류

많은 비즈니스 모델은 간단하지만 결함이 있는 외삽에 기반을 두고 구축되었습니다: comparable 모델 세대의 토큰당 비용이 떨어지면 총 청구서도 떨어질 것이라는 생각입니다. 이는 유도된 수요 원칙을 무시합니다.

도시 계획에서 고속도로에 차선을 추가한다고 교통이 줄어들지 않습니다; 오히려 더 많은 사람들이 통근하도록 유도하여 결국 새로운 차선을 채웁니다. AI도 동일한 패턴을 따릅니다. 추론이 더 저렴해지고 더 강력해질수록, 사용자는 단순히 더 적은 비용으로 같은 양의 작업을 하지 않고, 모델에게 요청하는 작업을 확장합니다.

한때 2분이 걸리던 추론 쿼리는 이제 4분이 걸립니다. 이전에 단일 프롬프트만 필요했을 수 있는 에이전트 워크플로는 이제 더 높은 수준의 자율성을 달성하기 위해 50번의 순차적 호출을 수행합니다. 단위 비용은 떨어지지만 단위 수가 폭발적으로 증가하여 총 지출이 순증가하게 됩니다.

하드웨어 병목 현상: 메모리와 GPU

소프트웨어 효율성이 개선되고 있지만, 공급 측면은 심각한 경제적 역풍에 직면해 있습니다. 프론티어 모델에 대한 주요 제약 조건은 더 이상 트랜지스터만이 아니라, 컴퓨트 다이에 메모리를 결합하기 위해 필요한 고대역폭 메모리(HBM)와 고급 패키징(예: TSMC의 CoWoS)입니다.

모건 스탠리에 따르면, 신형 NVIDIA 가속기의 재료비(BOM)가 크게 상승할 것으로 예상되며, 메모리 비용만으로도 massive growth(대규모 성장)를 보일 것입니다. 이러한 부족함은 GPU 가격을 단순한 기술 발전이 아닌 공급 제약의 반영으로 바꾸어 놓았습니다. HBM 가격이 18개월 동안 4배로 상승하고 전력/냉각 요구 사항이 기가와트 규모 캠퍼스 건설을 필요로 할 때, "저렴한 AI" 서사는 무너집니다.

이 재정적 압력은 연구소에서 가장 심각하게 느껴집니다. 보고에 따르면 프론티어 연구소는 수익보다 컴퓨팅에 수십억 달러 더 많이 지출하고 있어, 운영을 유지하기 위해 가격을 인상하도록 강요받고 있습니다.

지속 가능한 가격 표면으로 이동 중

제품 팀에게 있어 질문은 "어디에 AI를 추가할 수 있을까?"에서 "어떤 사용 사례가 소모한 추론 비용을 벌어들일까?"로 이동하고 있습니다. 이 변화에 생존하기 위해 기업들은 비용이 고정되어 있다고 가장하는 per-seat pricing에서 벗어나, 기반이 되는 사건에 수익을 연결하는 모델로 이동하고 있습니다.

1. Per-Action 가격 책정

Twilio 또는 AWS 모델과 유사하게, 모든 API 호출 또는 에이전트 단계에 가격이 책정됩니다. 이는 파워 유저가 시스템을 얼마나 heavily 사용하든 총 마진이 안정적으로 유지되도록 보장하지만, 투명성이 도입되어 더 공격적인 고객 협상을 초래할 수 있습니다.

2. 크레딧 기반 시스템

선불 버킷은 고객이 일정 용량을 구매하고 소진할 수 있게 합니다. 이는 여러 가지 다른 추론 제공업체 간에 라우팅되는 제품에 특히 유용합니다; 변동 비용을 단일 내부 단위로 추상화하기 때문입니다. 그러나 위험은 "breakage"—사용되지 않은 크레딧이 stranded assets가 되어 고객을 실망시킬 수 있다는 것입니다.

3. 하이브리드 모델

이것은 AI 네이티브 제품에 대한 가장 일반적인 수렴점입니다: 계약을 고정하는 기본 좌석 요금과 포함된 크레딧 및 측정된 초과 사용(안전 밸브 역할)을 결합한 형태입니다.

반론: 로컬 및 오픈소스 대안

모든 사람이 비용 곡선이 극복할 수 없는 벽이라고 동의하는 것은 아닙니다. 커뮤니티의 중요한 부분은 DeepSeek와 같은 고성능 오픈소스 모델의 상승이 독점 연구소의 반응 속도보다 훨씬 빠르게 비용을 낮추고 있다고 주장합니다.

"최첨단 모델은 더 나아지고 더 비싸질 것이며, 더 작은 모델은 더 저렴해질 것입니다... 저는 항상 가장 똑똑하고 가장 비싼 모델이 필요하지는 않습니다."

또한, 로컬 추론로의 전환은 클라우드 가격 전쟁에 대한 구조적 대안을 제시합니다. 소비자 하드웨어가 더욱 강력해짐에 따라 모델을 로컬에서 실행하는 것은 비용 절감 조치일 뿐만 아니라 보안상의 이점도 제공합니다. 산업이 "바이러스 스캐너" 모델로 이동한다면—사용자가 자신의 하드웨어에서 최신 모델 가중치를 다운로드하고 실행할 권리에 대해 비용을 지불하는 모델—전체 클라우드 추론 경제가 바뀔 것입니다.

불가능한 선택

정액제, per-seat pricing에 locked into 된 기업들은 이제 두 가지 선택 중 하나를 마주합니다: 사용량이 증가함에 따라 마진 압박을 흡수하거나, 하위 계층에서 AI 기능을 제거하여 사용자 획득 파이프라인을 위험에 빠뜨리는 것입니다.

자신의 비용과 보조를 맞춰 가격 구조를 피벗할 수 있는 기업들은 파산 없이 다음 세대의 에이전트 워크플로와 lourde reasoning 모델을 출시할 수 있는 기업들이 될 것입니다.

Sources