Tokenomics: Agentic Software Engineering에서의 토큰 소비량 정량화
Agentic SE의 주요 비용은 생성이 아닌 정제(Refinement)이다
LLM 기반 멀티 에이전트(LLM-MA) 시스템에 대한 연구에 따르면, 자동화된 소프트웨어 엔지니어링에서 가장 큰 자원 소모는 반복적인 정제 및 검증 단계에서 발생합니다. "Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering" 연구에 따르면, Code Review 단계가 전체 토큰 소비의 평균 59.4%를 차지합니다.
이 발견은 에이전트 비용에 대한 이해를 코드의 초기 생성에서 코드가 정확하고 기능적인지 확인하는 데 필요한 오버헤드로 전환시킵니다. 이는 에이전트 소프트웨어 엔지니어링의 실질적인 도입을 위한 주요 병목 현상이 모델의 생성 능력보다는 에이전트가 사용하는 협업 및 검증 프로토콜의 비효율성에 있음을 시사합니다.
SDLC 전반의 토큰 분포
이러한 비용을 정량화하기 위해, 연구원들은 GPT-5 reasoning model을 사용하는 ChatDev framework의 30개 소프트웨어 개발 작업 실행 트레이스를 분석했습니다. 연구는 내부 에이전트 단계를 Design, Coding, Code Completion, Code Review, Testing, Documentation으로 구성된 표준화된 소프트웨어 개발 생명주기(SDLC) 프레임워크로 매핑했습니다.
주요 소비 지표
- Dominant Stage: Code Review는 가장 비용이 많이 드는 단계로, 모든 토큰의 거의 60%를 소비합니다.
- Input vs. Output: Input 토큰이 소비의 가장 큰 비중을 일관되게 차지하며, 평균 **53.9%**를 나타냅니다.
- Resource Focus: 데이터는 에이전트 소프트웨어 엔지니어링의 비용이 초기 코드 초안 작성보다는 자동화된 정제 및 검증에 크게 치우쳐져 있음을 나타냅니다.
에이전트 협업의 비효율성
높은 Input 토큰 비중(53.9%)은 에이전트가 정보를 통신하고 처리하는 방식의 비효율성에 대한 실증적 증거를 제공합니다. 멀티 에이전트 시스템에서 에이전트들은 종종 사소한 조정을 위해 대규모 컨텍스트나 전체 코드베이스를 다시 읽습니다.
이 관찰 결과는 커뮤니티의 실무자들에 의해서도 확인됩니다. 한 개발자는 자신의 경험에서 현저히 높은 input-to-output 비율을 언급했습니다:
I'm seeing a ratio of around 10:1 in my usage... The agent will often read a million tokens just to patch one line of code.
이 패턴은 현재의 에이전트 워크플로우가 "토큰 집약적(token-heavy)"임을 시사하며, 컨텍스트를 제공하는 비용이 실제 솔루션을 생성하는 비용보다 훨씬 큽니다.
경제적 및 운영적 시사점
토큰 소비의 예측 불가능성은 AI 통합 소프트웨어 도구의 상업적 생존 가능성에 큰 장애물을 만듭니다. 반복적인 리뷰 사이클 동안 토큰 사용량이 급증할 수 있기 때문에, 기업들은 이러한 도구의 예산을 정확히 책정하기 어렵습니다.
시장 지속 가능성 및 가격 책정
커뮤니티 논의는 토큰 가격 책정의 임의성과 AI 라이선스 투명성 부족에 대한 커지는지는 우려를 강조합니다. 일부 사용자들은 가격 업데이트 이후 토큰 가용성에 급격한 변화를 보고하고 있으며, 이는 현재의 AI 비즈니스 모델이 제공자와 고객 모두에게 경제적으로 지속 가능하지 않을 수 있다는 의심을 불러일으킵니다.
토큰 최적화로의 전환
이러한 시스템을 실행하는 비용이 더 명확해짐에 따라, 엔지니어링 요구 사항의 변화가 예상됩니다. 초기 인프라 엔지니어가 하드웨어와 네트워크 효율성을 최적화하는 능력으로 가 가치를 인정받았던 것처럼, 미래의 소프트웨어 엔지니어는 운영 오버헤드와 환경적 영향을 줄이기 위해 AI 에이전트의 "토큰 효율성"을 최적화하는 능력으로 평가받을 수 있습니다.