Project Swap: 바터 경제에서의 AI 에이전트
TL;DR
Anthropic의 Project Swap 실험은 인간을 대신해 AI 에이전트가 거래를 성공적으로 협상할 수 있음을 보여주지만, 시장의 전반적인 효율성은 협상 과정보다 사용자의 선호를 얼마나 잘 이해하는지에 더 크게 제한된다. 더 강력한 모델은 더 효율적인 시장 결과를 가져오며, 짧은 인터뷰 대화로 사용자의 특성을 정확히 표현하는 능력이 주요 기술적 과제이다.
Project Swap 실험 설계
Anthropic는 전 세계 6개 사무소의 201명 직원을 대상으로 통제된 바터 경제 실험을 수행했다. 각 참가자는 기부할 책을 제공하고, Claude 기반 에이전트와 짧고 반구조적인 인터뷰를 통해 독서 취향을 설명했다. 이러한 에이전트들은 분산된 '거래장'에 진입하여 시간 제한이 있을 때까지 책을 제안하고, 협상하며 교환했다.
성공을 측정하기 위해 연구팀은 여러 기준을 사용했다:
- 기준 사실: 참가자들이 지역 책 풀에서 10권을 순위 매겨 실제 선호도를 기준으로 삼았다.
- Claude의 순위: 에이전트는 인터뷰 대화를 바탕으로 풀 내 모든 책의 순위를 구성했다.
- 이윤 극대화 최적치: 기준 사실 순위를 기반으로 한 이론적 최고 성능 할당.
- 최고 거래 사이클: 중앙집중식 결과를 비교하기 위한 표준 경제 규칙.
선호도 표현: 주요 제약 요소
에이전트가 사용자의 대리로 행동할 수 있는 능력은 사용자의 욕구를 얼마나 잘 이해하는지에 완전히 달려 있다. Project Swap는 실제 결과와 이론적 최적치 사이의 격차가 주로 표현 오류에 기인함을 드러냈다.
선호도 수집의 정확도
Claude의 순위는 평균 216단어의 인터뷰를 바탕으로 하여 참가자 자신의 순위와 61% 일치했다. 이는 단순한 인기 순위(53%)와 협업 필터링(55%)보다 우수했다. 연구는 인터뷰 설문에 더 많은 노력을 기울일수록 일치도가 높아짐을 발견했다. 150단어 대신 300단어를 작성하면 일치도가 약 4% 증가할 것으로 예측된다.
시장 실적 부족의 분해
이윤 극대화 최적치(0.89 점수)에 도달하지 못한 이유를 분석한 결과, 실적 부족은 다음과 같이 나뉘었다:
- 표현 격차: Claude의 부정확한 순위가 실적 부족의 85%를 차지했다(점수 0.60로 감소).
- 협상 격차: 분산된 '자유로운 협상' 과정이 나머지 15%를 차지했다(최종 평균 점수 0.55로 감소).
이는 에이전트가 노이즈가 있는 선호도 표현을 갖게 되면, 시장 설계(중앙집중식 vs. 분산식)가 최종 결과에 상대적으로 작은 영향을 미친다는 것을 시사한다.
모델 능력과 지침의 영향
Anthropic는 에이전트의 모델과 지침의 영향을 분리하기 위해 시장을 수십 번 재실행했다.
모델 성능
더 강력한 모델은 일관되게 더 효율적인 결과를 만들어냈다. Claude의 순위 기준으로 효율 점수는 다음과 같았다:
- Haiku: 0.75
- Sonnet: 0.80
- Opus: 0.88
- Fable: 0.86
혼합 모델 환경에서는 더 강력한 모델이 더 약한 모델보다 자신의 사용자에게 더 좋은 결과를 달성했다.
잔인한 vs. 사회적 지침
에이전트는 '잔인한'(사용자의 목표에만 집중)과 '사회적인'(사용자의 목표와 전체 시장의 성공에 집중)으로 나뉘었다.
- 결과: 잔인한 에이전트가 약간 더 높은 점수(약 0.02 높음)를 기록했다.
- 행동: 사회적 에이전트는 때때로 중요한 희생을 감수하는 경우가 있었는데, 예를 들어 다른 에이전트가 아무 책도 얻지 못하게 되는 것을 막기 위해 낮은 순위 책을 수락하는 경우였다.
에이전트 협상 전술
거래장 메시지를 분석한 결과, 세 가지 범주에 걸쳐 16가지 일반적인 전술이 발견되었다:
- 압박: 시간 제한이나 의무감에 호소하기.
- 제안: 경쟁 책과 비교하거나 수상 내역을 인용하기.
- 조정: 대기 목록 만들기 또는 다른 에이전트를 위한 제3자 중개자 역할 하기.
전략적으로 대부분의 에이전트(78%에서 96%)는 자신의 최상위 책을 거래장에 공개했지만, 전체 순위를 공개하는 경우는 거의 없었는데, 이는 상대방에게 전략적 우위를 주기 때문이다.
사용자 신뢰와 위임 책임의 함의
실험 후 참가자들은 평균 7.2/10의 만족도를 보고했다. AI 에이전트가 자율적으로 연간 책 예산의 몇 퍼센트를 관리하는 데 신뢰할 수 있는지 묻자, 평균 응답은 30%였다—이는 잘 읽는 친구에게 신뢰할 수 있는 비율(약 40%)의 약 3분의 4에 해당한다.
위임 책임과 관찰 가능성
이 연구는 에이전트가 더 높은 위험 시장에서 위임 책임을 수행하기 위해 두 가지 유형의 검증이 필요하다고 제안한다:
- 일반 인증: 특정 분야에서 에이전트의 일반적 능력을 테스트하는 것.
- 개별화된 검증: 에이전트가 특정 사용자의 선호를 이해하고 있음을 행동 전에 '샘플 테스트'로 입증하는 것.
또한 연구팀은 관찰 가능성(에이전트의 행동 로그를 검토할 수 있는 능력)이 사용자 구제와 신뢰에 매우 중요하다고 지적했다. 이는 사용자가 특정 거래가 왜 이루어졌는지 또는 누락되었는지 이해할 수 있도록 해주기 때문이다.