Tokenmaxxing의 부상: AI 지표가 목표가 될 때
최근 보고서에 따르면 Amazon 직원들 사이에서 'tokenmaxxing'이라는 트렌드가 확산되고 있습니다. 이는 더 생산적으로 보이거나 기업의 지침을 준수하는 것처럼 보이기 위해 AI 도구가 소비하는 토큰 수를 의도적으로 부풀리는 관행을 의미합니다. 이러한 현상은 생성형 AI(GenAI)를 통합하려는 경영진의 열망과 소프트웨어 엔지니어링 작업이 실제로 수행되는 방식 사이의 심각한 괴리를 보여줍니다.
본질적으로 tokenmaxxing은 결함이 있는 인센티브 구조에 대한 합리적인 반응입니다. 리더십이 AI 사용량과 연계된 핵심 성과 지표(KPI)를 도입하면, 의도치 않게 생산성 도구를 수치적 준수의 게임으로 변질시킵니다. 이는 '측정치가 목표가 되는 순간, 그것은 더 이상 좋은 측정치가 아니게 된다'는 굿하트의 법칙(Goodhart's Law)이 나타나는 전형적인 사례입니다.
토큰 계산의 왜곡된 인센티브
많은 엔지니어에게 AI 도구를 도입해야 한다는 압박은 소프트웨어의 유용성 때문이 아니라, 해고에 대한 두려움이나 임의적인 성과 할당량을 채우려는 욕구에서 비롯됩니다. 이는 다음과 같은 여러 역효과를 낳는 행동으로 이어집니다.
- 의도적인 비효율성: 엔지니어들은 더 많은 토큰을 소모하기 위해 모호하고 개방적인 지침을 제공하거나, 단순한 작업에 대해 AI에게 '깊이 생각하라'고 요청할 수 있습니다.
- 무의미한 작업 수행: 일부는 실제 작업을 병행하는 동안 AI에게 '전체 코드베이스 요약하기'와 같이 의미 없는 작업을 시키는 것으로 보고되었습니다.
- 컨텍스트 비대화: 문서에 따르면 컨텍스트가 커질수록 AI 성능이 저하됨에도 불구하고, 단순히 토큰 소비를 늘리기 위해 거대한 컨텍스트 윈도우(context windows)를 유지하려는 경향이 있습니다.
한 댓글 작성자가 언급했듯이, 토큰 사용량을 생산성 지표로 측정하는 것은 키스트로크(keystrokes)를 측정하는 것과 비슷합니다.
"제 말은 신경 쓰지 마세요, 그냥 금요일에 쉬기 위해 한 시간 동안 키보드에 얼굴을 비비고 있을 뿐이니까요... 다만 각 키스트로크에는 비용이 따르며, 그 합계가 제 급여와 같거나 더 클 수도 있다는 점이 다를 뿐이죠."
결함 있는 지표의 역사
기술 전문가들은 tokenmaxxing을 잘못된 경영 지표의 오랜 역사 속에서 나타난 현대적 진화로 보고 있습니다. 커뮤니티에서는 이를 '코드 라인 수(LOC)'나 일일 커밋(commit) 횟수를 통해 생산성을 측정하던 관행과 자주 비교합니다.
엔지니어가 LOC 할당량을 채우기 위해 비대하고 비효율적인 코드 1,000줄을 작성할 수 있는 것처럼, 이제는 경영진의 대시보드를 만족시키기 위해 수천 개의 중복된 AI 출력 토큰을 생성할 수 있습니다. 두 경우 모두, 지표는 전달된 가치보다는 작업의 외형에 보급을 줍니다. 이는 '시스템을 속이는' 능력으로 인해 평범한 인재가 과대평가되는 반면, 가장 효율적인 엔지니어—가장 적은 토큰으로 문제를 해결하는 엔지니어—는 생산성이 낮은 것처럼 보일 수 있는 문화를 조성합니다.
경영진의 격차: 10x 기대치 vs. 현실
비기술직 리더십의 기대치와 개발자 경험 사이에는 상당한 격차가 존재합니다. 경영진은 AI가 회사의 산출물을 '10x'로 만들 것이라고 믿을 수 있지만, 엔지니어들은 실제 향상 폭이 40-60% 정도라고 말합니다.
이러한 불일치는 직원들이 '뒤처지는 사람'으로 보이지 않기 위해 AI 도입을 가장해야 한다는 스트레스가 가득한 환경을 만들어냅니다. 반대로, 일부 직원들은 엄격한 토큰 할당량 때문에 진지하고 가치 높은 작업을 위해 AI를 사용하는 데 어려움을 겪는 반면, 경영진은 동시에 코드의 높은 비율이 AI로 생성되어야 한다고 요구하는 모순된 상황에 처하기도 합니다.
결과 중심 평가로의 전환
일부 Amazon 직원들은 자신의 팀이 정확도, 수정된 버그 수, 또는 GenAI의 창의적 활용과 같은 산출물 지표에 집중하고 있다고 보고하지만, 전반적인 트렌드는 철학적 전환의 필요성을 시사합니다.
tokenmaxxing의 함정을 피하기 위해, 조직은 활동 기반 지표에서 결과 중심 평가로 이동해야 합니다 합니다. AI가 제대로 작동하는지 판단하는 가장 효과적인 휴리스틱(heuristic)은 간단합니다: "결과를 보여주세요."
결과를 달성하기 위해 얼마나 많은 토큰을 소생했는지보다는, 그 결과가 실제 가치 있는지를에 집중함으로써, 기업은 내부 갈등을 피하고 AI가 경영진을 위한 퍼포먼스 아트가 아닌 생산성을 위한 도구로 사용되도록 보장할 수 있습니다.