에이전시 바운티 함정: AI 코딩 에이전트가 오픈소스 바운티에서 어려움을 겪는 이유
"자율 AI 에이전트"라는 약속은 개발자 커뮤니티의 상상력을 사로잡았다. 최근 바이럴 트윗에서는 코딩 에이전트가 감독 없이 22시간 동안 실행되어 바운티를 발견하고, 풀 리퀘스트(PR)를 제출해 $16.88을 벌었다고 주장했다. 많은 사람들에게 이는 개념 증명처럼 느껴졌으며, 루프가 드디어 닫혔고 AI가 오픈소스 이슈를 해결함으로써 수동 소득을 창출할 수 있게 되었다.
하지만, 공개 바운티 시장의 현실은 그리 승리적이지 않다. Claude를 사용해 modest $20 token budget로 이 성공을 재현하려는 시도에서 개발자 ztc00은 바이럴 트윗과 지속 가능한 비즈니스 모델 사이의 격차가 크다는 것을 발견했다. 결과는 $0 수익과 현재 AI 기반 오픈소스 기여 상황에 대한 냉정한 데이터였다.
실험: 자동화 vs. 현실
설정은 간단했다: Claude를 에이전트로 사용해 Algora(유지보수자가 GitHub 이슈에 금액을 붙이는 플랫폼)에서 공개 바운티를 찾아내고, 저장소를 복제한 뒤 수정을 시도하고 테스트를 실행한다. 제출 전 PR의 품질을 보장하기 위해 인간이 루프에 참여하는 검토를 유지했다.
루프의 기술적 가능성에도 불구하고, 실험은 기술적인 것이 아니라 시스템적인 즉각적인 장애물에 부딪혔다. 처음 마주한 바운티는 $100 규모의 TypeScript 이슈였지만, "Reserved for SE interview" 라벨 뒤에 가려져 있었다. 유지보수자는 이미 후보자를 채용하기 위해 의도된 바운티를 "훔치려는" 사용자들을 금지한 바 있다. 이는 중요한 첫 번째 교훈을 강조한다: 많은 공개 바운티가 실제로는 공개되지 않았으며, 채용 도구로 사용되고 있다.
데이터: 포화된 시장
전망을 더 잘 이해하기 위해, 저자는 scout.py라는 도구를 만들어 Algora 라벨이 붙은 공개 이슈를 분석했다. 데이터는 거의 모든 바운티가 다음 세 가지 문제 카테고리 중 하나에 해당한다는 것을 보여주었다:
- Sandbox Spam: AI 시도가 요구하는 토큰 비용이 잠재적인 보상보다 큰 저가 바운티(예: $1).
- Hyper-Saturation: 합법적인 바운티($50–$1,000)는 종종 몇 시간 안에 8~158개의 "/attempt" 댓글을 끌어모은다. 에이전트가 이슈를 식별할 때쯤이면 이미 10개 이상의 열린 PR이 진행 중인 경우가 많다.
- The Deadlock: 유지보수자가 사냥꾼을 지정했지만 그 사냥꾼이 침묵하고, 다른 기회주의적 기여자들의 PR은 지정된 사용자를 "뺏어먹었다"는 이유로 병합되지 않고 닫히는 이슈.
결론은 명확하다: 공개 바운티 시장은 이제 "남획된 연못"이다. 에이전트가 밀리초 안에 바운티를 차지할 수 있기 때문에 병목 현상은 해결책을 찾는 단계에서 유지보수자 검토 단계로 이동했다. 유지보수자는 단일 $50 버그에 대해 현실적으로 15개의 PR을 검토할 수 없으며, 보통 첫 번째 수용 가능한 PR을 선택하고 나머지는 거부한다.
"성숙" 전략
속도가 패배 전략임을 인식하고, 저자는 "수확" 전략으로 전환했다. 첫 번째가 되기 위해 경쟁하는 대신, 도구는 "성숙한" 바운티를 표시하도록 설계되었다—이미 청구되고 할당되었지만 열린 PR이 없고 14일 이상 침묵한 이슈. 이론적으로 많은 공격적인 바운티 사냥꾼이 이를 끝까지 수행하지 못한다는 것이었다.
논리에도 불구하고, 이틀에 걸친 세 번의 스캔에서는 성숙한 후보가 전혀 나오지 않았다. 이는 "버려진" 시장조차도 너무 작거나 다른 에이전트에 의해 너무 효율적으로 감시되고 있음을 시사한다.
핵심 인사이트와 반론
Hacker News에서의 커뮤니티 반응은 실험에 사회학적 비판의 층을 더했다. 이 접근 방식의 지속 가능성에 대해 몇 가지 점이 부각되었다:
공동체 비극
비평가들은 AI가 생성한 PR이 오픈소스에 "공동체 비극"을 초래하고 있다고 주장했다. 수백 명의 에이전트가 저장소에 저품질 또는 약간 부정확한 솔루션을 쏟아부으면 유지보수자에게 엄청난 잡음이 발생한다.
"자신의 것이 아닌 프로젝트에 대한 AI 기여는 무의미합니다. 우리 모두가 같은 모델에 접근할 수 있기 때문에 잡음 층을 추가한다고 해서 누구에게도 호의를 베푸는 것이 아닙니다."
유지보수자의 부담
일부 사용자는 기업들이 실제로 중단하고 있다는 점을 언급했다. 신호 대 잡음 비율이 급락했기 때문이다. AI가 생성한 오탐을 선별하는 데 드는 노력은 종종 수정의 이점을 능가한다.
경제적 오산
ROI 관점에서 보면, 단위 경제성은 불안정하다. 에이전트가 토큰으로 $16을 사용해 $16.88을 벌면 이익률은 미미하다. 바이럴 성공 사례는 아마도 단일 스레드, 토큰당 결제 스크립트가 아니라 정액 구독으로 병렬 실행되는 "플릿" 에이전트에 기인할 가능성이 크다.
미래 AI 에이전트를 위한 교훈
자율 코딩 에이전트를 구축하려는 이들을 위해, 실험은 세 가지 전환점을 제시한다:
- 공개 파이프라인 피하기: Algora와 같은 공개 게시판에서 벗어나 솔루션의 품질과 깊이가 제출 속도보다 중시되는 사설 보안 플랫폼(HackerOne, Bugcrowd)으로 이동한다.
- 먼저 신뢰 구축: OSS에 기여하는 유일한 지속 가능한 방법은 인정받는 기여자가 되는 것이다. 유지보수자는 신뢰하는 사용자로부터 온 PR을 병합하고 보상할 가능성이 높다.
- 사냥꾼이 아니라 도구 구축: 포화된 시장에서 경쟁하기보다, 다른 이들이 시장을 탐색하도록 돕는 인프라(예:
scout.py)를 구축한다.
궁극적으로, 실험은 AI 코딩의 "루프"가 기술적으로는 작동할 수 있지만, 경제적 루프는 현재 깨졌음을 증명한다. 시장은 AI 에이전트의 속도가 전통적인 공개 바운티 모델을 구식으로 만든 균형점에 도달했다.