GLM 5.3 Flash와 함께한 한 달간의 코딩 – 비용, 에너지, 인프라에 대한 교훈

TL;DR

Wagtail은 한 달 동안 GLM 5.3 Flash만 독점적으로 사용하려고 시도했습니다. 전반기에는 예산 범위 내($68, 약 4 kWh, 365 g CO₂)를 유지했으나, 후반기에는 다른 모델로 분산되면서 10억 개의 토큰을 추가로 소비했고 총 에너지 사용량이 약 35 kWh까지 증가했습니다. 이 실험은 모델 선택, 에이전트 패턴, 그리고 제공업체의 용량이 비용과 탄소 발자국에 직접적인 영향을 미친다는 것을 증명합니다.


실험의 목적

팀은 2026년 9월의 모든 AI 기반 코딩 작업을 GLM 5.3 Flash에서 수행하는 것을 목표로 했습니다. 이는 100만 토큰 컨텍스트 윈도우, 비전 지원, 광범위한 제공업체 가용성을 갖춘 플래시 티어의 오픈 웨이트 모델입니다. 성공한다면 단 하나의 효율적인 모델로 대부분의 프로덕션 및 R&D 작업을 처리하면서 비용과 배출량을 낮게 유지할 수 있음을 입증할 수 있었습니다.

실제 결과

전반기: 모델 중심의 성공

  • 예산 준수 – $68 지출, 약 4 kWh의 전력 소비, 365 g의 CO₂ 배출.
  • 작업 범위 – UI 작업, AI R&D, 문서화, 코드 평가 모두 GLM 5.3 Flash에서 실행됨.
  • 성능 하이라이트 – 대규모 컨텍스트 윈도우 덕분에 장시간 코딩 세션이 가능했으며, 비전 기능으로 모델이 스크린샷을 해석할 수 있었음.

후반기: 예상치 못한 토큰 분산

  • 토큰 유출 – 10억 개의 토큰(해당 월 총량의 약 50%)이 DeepSeek V4.1 Flash 및 Qwen 3.8 Flash와 같은 다른 모델로 라우팅됨.
  • 비용 상승 – 바이브 코딩(vibe-coded) MCP 서버를 위해 "잘못된" 모델을 사용한 프로토타입으로 인해 하룻밤 사이에 $150와 약 5 kWh의 에너지가 추가로 소비됨.
  • 인프라 병목 현상 – 인기 있는 추론 제공업체들이 GLM 5.3 Flash의 속도를 제한하여, 어쩔 수 없이 대체 모델로 전환해야 했음.

발견된 주요 문제점

1. 모델 선택은 생각보다 훨씬 중요함

"우리는 프로토타입에 잘못된 모델을 선택했다는 이유로 하룻밤 사이에 4억 5천만 토큰 / $150 / 5 kWh를 소비했습니다." – ThibWeb

  • 에이전트 워크플로우에 적합하지 않은 모델을 선택하면 토큰 폭발이 발생할 수 있음.
  • 팀은 5배 더 저렴한 대안으로도 훨씬 적은 비용으로 비슷한 결과를 얻을 수 있었을 것으로 추정함.

2. 제공업체의 용량 제한이 신뢰성에 영향을 미침

  • GLM 5.3 Flash는 비용 대비 성능의 파레토 최적(Pareto frontier) 근처에 위치하여, 공유 추론 클러스터에서 수요가 매우 높음.
  • 용량 부족은 지연 시간 저하로 나타났으며, 여러 제공업체에서 모델을 사용할 수 있음에도 불구하고 강제로 모델을 전환해야 하는 상황이 발생함.

3. 에너지 및 비용 보고는 간단하지 않음

  • 이 실험은 제공업체가 제공한 지표(예: NeuralWatt의 에너지 추정치)에 의존함. 일부 댓글 작성자들은 보고된 kWh에 이윤 마진이 포함되어 있을 수 있다고 지적하며 이러한 수치의 정확성에 의문을 제기함.
  • 진정한 예산 관리를 위해서는 토큰 사용량과 전력 소비량 모두에 대한 정확한 로컬 측정이 필수적임.

커뮤니티 인사이트

  • 에너지에 대한 놀라움 – 한 댓글 작성자는 4 kWh가 금전적 비용의 *단 1%*에 불과하며, 전기차를 약 15마일 운전하는 것과 비슷하다고 강조하며, 보고된 에너지 발자국이 기대치에 비해 얼마나 낮은지 지적함.
  • 지표 비판 – 다른 이들은 모델마다 토큰 효율성과 속도가 다르기 때문에 토큰당 비용 그래프가 오해를 불러일으킬 수 있다고 지적함. 작업당 시간이나 작업당 비용과 같은 대체 지표가 더 실질적인 도움이 될 수 있음.
  • 모델별 가격 책정 – DeepSeek의 API는 우수한 캐싱 기능 덕분에 타사 애그리게이터보다 저렴할 수 있으며, GLM 5.3 Flash 가격은 제공업체(예: Z-AI vs. NeuralWatt)마다 다름.
  • 에이전트 워크플로우 팁 – 성공적인 실무자들은 플래시 모델을 전용 플래너 및 리뷰어 에이전트(예: 계획을 위한 Astra-Low, 검토를 위한 SOL 6.1-Medium)와 결합하여 신뢰성을 높임.

GLM 5.3 Flash의 장점

  • 100만 컨텍스트 윈도우 – 청킹(chunking) 없이 대규모 코드베이스를 처리할 수 있음.
  • 비전 기능 – 모델이 스크린샷과 시각적 QA를 처리할 수 있게 함.
  • 교차 제공업체 가용성 – 경쟁과 가격 차익 거래를 장려함.
  • 범용성 – UI 작업, 코딩, 문서화, 평가 등을 큰 성능 저하 없이 처리함.

구체적인 교훈 및 다음 단계

  1. 지속적인 로컬 측정 구현 – 토큰, 비용, 에너지를 측정하여 급증하는 지점을 조기에 포착함.
  2. 실험을 위한 전용 예산 할당 – 일상적인 프로덕션과 분리하여 프로토타입이 비용 제약 내에서 평가되도록 함.
  3. 멀티 에이전트 오케스트레이션 개선 – 역할(오케스트레이터, 스카우트, 구현자, 리뷰어)을 명확히 정의하고 목표를 제한하여 토큰 사용량 폭주를 방지함.
  4. 효율적인 모델 우선순위 지정 – 추론 작업의 대부분을 플래시 티어 모델에서 실행하도록 하고, 단순 토큰 수가 아닌 비용/에너지로 성공을 측정함.
  5. 제공업체 용량 모니터링 – 대체 전략을 구축하고 지연 시간 추세를 추적하여 강제적인 모델 전환을 사전에 방지함.

최종 결론

한 달간의 도전은 모든 작업을 GLM 5.3 Flash에서 유지하는 데 50%만 성공했지만, 모델 선택, 에이전트 설계, 인프라 제약이 실제 비용을 어떻게 결정하는지에 대한 귀중한 데이터를 제공했습니다. Wagtail은 측정, 예산 책정, 오케스트레이션을 강화하여 10월 AI 워크플로우의 핵심으로 플래시 티어 모델을 활용할 계획입니다.


*11월에 열리는 **Wagtail Space 2026*에 참여하여 이러한 교훈이 어떻게 실무로 이어지는지 확인해 보세요.

Sources

관련