스포티파이 포털 AiKA 모드를 통해 클로드 코드의 토큰 사용량을 90% 감소시키는 저비용 모델 위임
핵심 포인트
스포티파이의 포털 AiKA 모드는 클로드 코드가 대규모 파일 읽기와 반복 코드 생성을 저비용 모델(Gemini 2.5 Flash)에 위임함으로써, 동일한 워크플로우를 유지하면서도 클로드의 토큰 사용량을 약 90% 감소시켰다.
AI 보조 코딩에서 토큰 비용이 중요한 이유
- 입력 토큰(소스 파일 읽기)은 출력 토큰보다 훨씬 더 자주 발생하므로 AI 코딩 에이전트의 비용을 주도한다.
- 가트너는 2028년까지 AI 코딩 토큰 지출이 평균 개발자 급여를 초과할 것으로 예측하며, 많은 팀이 월간 개발자당 200~500달러를 지출하고 있으며, 일부는 2,000달러를 넘는다.
- 따라서 기능을 희생하지 않고 토큰 소비를 줄이는 것은 핵심적인 비용 절감 조치이다.
핵심 아이디어: AiKA 모드를 활용한 모델 라우팅
- AiKA 모드는 선언형 에이전트로, 일시적인 런타임(예: AWS Lambda와 유사)에서 실행되며 포털 CLI 또는 API를 통해 호출할 수 있다.
- 모드는 다음을 포함한다:
- 시스템 프롬프트(지침)
- 선택한 모델(포털에 구성된 어떤 모델이든 가능)
- 온도와 같은 런타임 파라미터
- 선택적 MCP 도구
- 모드는 공개(회사 전체 공유 가능) 또는 비공개(팀 전용)이며, 인프라나 API 키 관리가 필요 없다.
토큰 절감을 위해 사용된 두 가지 구체적인 모드
1. bulk-reader
- 목적 – 여러 대규모 파일의 내용을 요약하여 클로드가 각 파일을 직접 읽지 않고도 질문에 답변할 수 있도록 한다.
- 핵심 지침 – 구조화된 버블릿만 출력하고, 논문 형식이나 마크다운 경계를 사용하지 않는다.
- 모델 – Gemini 2.5 Flash (다른 모델로 교체 가능).
name: bulk-reader
description: 코드 분석을 위한 대량 파일 리더 - 클로드 코드의 I/O를 위임
instructions: |
당신은 정확한 코드 분석가입니다. 제공된 파일을 읽고 질문에 간결하게 답변하세요.
구조화된 버블릿만 출력하세요. 인사말, 논문 형식, 서론은 없어야 합니다.
모든 버블릿은 정확한 이름, 유형, 또는 줄 번호로 시작하세요.
세부 정보는 중첩된 버블릿을 사용하세요. 호출자가 요청하지 않은 내용은 건너뜁니다.
visibility: public
model: gemini-2.5-flash
resourceLimits:
temperature: 0.2
tags:
- coding
- delegation
2. code-writer
- 목적 – 기존 프로젝트 패턴을 따르는 반복 코드(테스트, 설정 스텁, 타입 스텁)를 생성한다.
- 핵심 지침 – 오직 코드만 출력하고, 마크다운 경계로 감싸지 마세요.
- 모델 – Gemini 2.5 Flash (교체 가능).
name: code-writer
description: 반복 코드 생성기 - 클로드 코드의 출력 집약 작업을 위임
instructions: |
당신은 사양과 참조 파일을 기반으로 코드 파일을 생성합니다. 기존 패턴,
관례, 이름 지정, 스타일을 정확히 일치시켜야 합니다. 설명이나 마크다운 경계는 포함하지 마세요. 요청되지 않은 경우에만 마크다운 경계를 사용하세요.
사양이 모호한 경우, 참조 코드의 패턴과 일치하는 합리적인 선택을 하세요.
visibility: public
model: gemini-2.5-flash
resourceLimits:
temperature: 0.2
tags:
- coding
- delegation
라우팅을 강제하는 방법: shunt 플러그인
- 툴 사용 전 후크 –
shunt는 클로드 코드에 두 개의PreToolUse후크를 등록한다.check-file-size는 설정 가능한 줄 수 임계값(기본값 350)을 초과하는 파일의Read호출을 차단한다. 후크는 클로드에게/bulk-reader기술로 이동하도록 안내하는 메시지를 반환한다.check-bash-read는 대규모 파일에서cat,head,tail,less,more를 차단하지만, 타겟된 파이프라인(예:cat file | grep)은 허용한다.
- 쉘 래퍼 – 두 개의 베이시스크립트(
bulk-read및code-write)가 포털 CLI를 호출하고, 인수를 전달하며, 오류를 처리하고 토큰 사용량을 보고한다.bulk-read --question "..." --paths src/Service.java src/Handler.javacode-write --spec "UserService에 대한 테스트 작성" --reference tests/OrderTest.java --target tests/UserTest.java
- 기술 파일 – 마크다운 기술 정의는 클로드가 후크가 읽기를 차단했을 때 호출할 정확한 CLI 구문을 제공한다.
- 기술 설명은 선택 사항이며, 후크가 이미 비용이 큰 읽기를 방지하기 때문이다.
측정된 토큰 절감 효과
- 시나리오 – 자바 모노레포, 네 가지 일반적인 코딩 작업(대량 파일 쿼리, 테스트 생성, 설정 스텁 생성, 타입 스텁 생성).
- 결과 – 클로드의 직접 읽기는 블록 리더 요약보다 입력 토큰을 약 10배 더 소비했다. 블록 읽기의 평균 토큰 감소율은 **약 90%**였다.
- 코드-라이터 – 클로드는 참조 파일의 입력 토큰과 출력 토큰을 모두 소비했을 것이므로, 절감 효과를 정량화하기 어렵다.
shunt를 사용하면 생성된 코드가 클로드의 컨텍스트에 들어가지 않아 출력 토큰을 완전히 제거한다.
제한 사항과 트레이드오프
- 편집 위임 불가 – 요약본에는 신뢰할 수 있는 줄 번호가 없기 때문에, 정밀한 편집을 위해 클로드는 여전히 원본 파일을 읽어야 한다.
- 이해 위임 불가 – 복잡한 버그 탐지나 아키텍처 결정은 여전히 클로드가 담당한다. 저비용 모델은 미묘한 문제(예: 스레드 안전성 버그)를 놓칠 수 있다.
- 지연 시간 – 각 위임은 클로드 → 포털 → 워커 모델 → 클로드 사이의 10~30초 라운드트립을 추가한다. 포털은 호출을 30초로 제한하므로, 매우 큰 생성 작업은 분할해야 하며, 이로 인해 소규모 읽기에 위임이 적합하지 않다.
- 비용 회계 – 토큰 절감은 클로드의 사용량만 측정된다. 저비용 모델은 여전히 자체 토큰 비용을 발생시키지만, 요청당 비용은 크게 낮다.
AiKA 모드의 재사용성과 확장성
- 재사용 가능 – 동일한
bulk-reader및code-writer모드는 포털 CLI를 호출할 수 있는 어떤 프로젝트나 도구에서든 사용할 수 있다. - 공유 가능 – 모드는 AiKA 카탈로그에서 공개되어 있으며, 스포티파이 엔지니어라면 새 모드를 생성하지 않고도 사용할 수 있다.
- 조합 가능 –
doc-writer,reviewer,translator와 같은 새로운 모드는 몇 번의 클릭만으로 동일한 템플릿에서 만들 수 있다. - 분리된 라우팅 –
shunt플러그인은 언제 위임할지를 결정하고, 모드는 어떻게 응답할지를 결정한다. 워커 모델을 교체하거나 프롬프트를 조정하거나 MCP 도구를 추가하려면 모드 편집만 하면 되며, 플러그인 변경이 필요 없다.
직접 시작하기
- 플러그인 설치
claude plugin marketplace add spotify/portal-ai-plugins claude plugin install portal@portal claude plugin install shunt@portal - 포털 CLI 구성 – 클로드 코드 세션에서
/portal:setup을 실행하고 포털 인스턴스에 인증한다. - 모드 사용 – 여러 파일을 포함하는 질문을 클로드에게 묻는다.
shunt후크가 자동으로 대규모 읽기를bulk-reader로 리디렉션하고, 반복 코드 생성을code-writer로 전달한다. - 필요 시 사용자 정의 – 포털에서 공개 모드를 포크하고, 모델이나 지침을 조정하면, 포크된 버전이 자동으로 우선 적용된다.
커뮤니티 반응 (선택된 HN 댓글)
"토큰 사용량이 줄어드는 이유는 읽기/코드 작성 작업에 대해 다른 토큰 예산을 가진 다른 서비스를 사용하기 때문이다." – jnwatson
"크기 기반 라우팅은 코드 복잡도에 대해 아무 정보도 제공하지 않는다; 출력 토큰은 입력 토큰보다 훨씬 비싸다." – ricardobeat
"이 접근법은 사실상 그레프와 반복 코드에 대해 저비용 모델로 위임하는 것뿐이며, 본질적으로 새로운 것은 없고 단지 구성 레이어일 뿐이다." – tolugenius
"각 위임당 10~30초의 지연 시간은 소규모 작업에 있어서 결정적인 문제일 수 있다." – krzys
결론
포털의 AiKA 모드는 비용이 큰 모델 라우팅을 간단한 선언적 구성으로 전환한다. 대량 I/O와 예측 가능한 코드 생성을 저비용 모델에 위임함으로써, 스포티파이 엔지니어는 클로드 코드의 입력 소비량에서 약 90%의 토큰 절감을 달성했으며, 동일한 개발자 경험을 유지했다. 트레이드오프(추가 지연 시간, 편집 및 심층적 추론 위임 불가)는 예측 가능하므로, 이 솔루션은 프론티어 코딩 에이전트를 사용하는 모든 조직에 실용적인 비용 통제 패턴이 될 수 있다.
Sources
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- Dispatch