클로드 사용 데이터에 대한 앤트로픽 독립 연구 프로젝트
앤트로픽은 외부 연구자들이 실제 클로드 사용 데이터를 독립적으로 분석할 수 있도록 하는 프로젝트를 시작했습니다. 개인정보 보호를 고려한 분석 도구인 Anthropic Insights를 제공함으로써, 연구소 내부 보고서나 왜곡된 공개 데이터셋에 의존하지 않고, 인공지능이 사회에 미치는 영향을 분산된 방식으로 이해하려는 목표를 달성하고자 합니다.
외부 연구 그룹의 주요 발견
세 개의 연구 기관이 2026년 4월~5월 기간 동안 약 25만 건의 Claude.ai 및 Claude Code 대화 데이터를 분석했습니다. 연구자들은 독립적으로 작업했으며, 앤트로픽의 검토 권한은 개인정보 보호, 사용 정책 위반 여부, 사실 정확성에 한정되었습니다.
인간-AI 협업 (스탠퍼드 SALT 랩)
스탠퍼드 대학교의 사회 및 언어 기술(SALT) 랩은 인간과 AI가 어떻게 협업하는지에 초점을 맞추었고, 사용자들이 고위험 업무를 자주 AI에 위임한다는 점을 발견했습니다.
- 중대한 업무 위임: 이전 연구에서 AI는 주로 책임이 낮은 업무에 사용된다고 보고했지만, 분석된 대화의 절반 이상이 중대한 영향을 미치는 작업—되돌리기 어려운 작업이나 타인에게 영향을 주는 작업—을 포함했습니다. 이는 특히 법적 및 재정적 질문에서 가장 두드러졌습니다.
- 인간의 감시: 거의 75%의 대화에서 인간이 방향성과 감시를 유지했으며, 일반적으로 AI의 출력을 그대로 사용하기보다는 수정하여 사용했습니다.
- 생산적인 긴장감: 요청을 반복하고 의도를 명확히 하기 위한 노력이 종종 더 나은 최종 결과를 초래했으며, 협업 과정에서의 긴장감이 생산적인 역할을 할 수 있음을 시사합니다.
사용자 감정과 AI 행동 (옥스포드 대학교)
옥스포드 대학교의 인간 정보 처리 연구실은 사용자 감정과 모델 행동 간의 상관관계를 연구했습니다.
- 행동 상관관계: 사용자 감정이 긍정적일수록 모델의 '따뜻한' 행동이 나타났고, 모델의 거부나 반론은 사용자의 반발과 관련이 있었습니다. '이상한' 모델 행동은 사용자의 지적 참여도가 높을 때와 연결되었습니다.
- 디지털 활동의 유사성: 클로드 대화에서 관찰된 몰입, 좌절, 즐거움의 패턴은 일반적인 인터넷 탐색 연구에서 발견된 패턴과 매우 유사했습니다.
코딩 생산성 (METR)
METR는 클로드 코드 대화를 분석하여 모델 세대 간 실제 생산성 향상을 추정했습니다.
- 모델 능력과 속도: 초기 결과에 따르면, 최신 모델 세대는 이전 버전보다 상당한 속도 향상을 제공합니다.
- 시간 추정 정확도: 연구는 AI 없이 작업하는 데 걸리는 시간에 대한 클로드의 내부 추정치가 이전 연구에서의 개발자 완료 시간과 합리적으로 일치한다는 점을 발견했습니다.
기술적 구현: Anthropic Insights
사용자 개인정보를 보호하기 위해, 연구자들은 원시 대화 데이터에 접근할 수 없었습니다. 대신 Anthropic Insights라는 도구를 사용하여 질문을 제기하고, 모델이 대화를 분류한 후 집계된 비율을 제공받았습니다.
외부 확장의 도전 과제
앤트로픽은 내부 연구에서 외부 연구로 전환할 때 발생하는 여러 운영적 장애를 식별했습니다.
- 프롬프트 민감성: 연구자들이 원시 데이터를 볼 수 없기 때문에, 잘못된 표현의 질문이 오해를 불러일으키는 분류를 초래했는지 쉽게 파악할 수 없습니다. 이를 완화하기 위해 연구자들은 공개된 WildChat 데이터셋에서 질문을 테스트했지만, 앤트로픽은 WildChat의 비공식적인 성격이 항상 실제 클로드 트래픽과 정확히 일치하지 않는다고 지적했습니다.
- 자원 집약성: 모든 데이터셋 공유 시 반복적인 개인정보 보호 검토가 필요했기 때문에, 프로젝트는 표준 내부 연구 주기보다 더 느리고 자원 소모가 컸습니다.
- 정책 집행: 사용자가 금지된 지침을 요청하는 등의 사용 정책 위반 사례가 도구에서 발견된 경우, 앤트로픽은 집계된 데이터를 안전 보호 팀과 공유했습니다. 전체 사례의 5% 미만에서, 앤트로픽은 보호 장치를 회피하는 방법을 설명하는 특정 분류를 제거하여 추가적인 오용을 방지했습니다.
미래 전망 및 데이터 공개
앤트로픽은 이 세 프로젝트의 집계 데이터를 허깅페이스에 공개했습니다. 연구소는 현재 더 많은 연구자들을 지원하면서도 엄격한 개인정보 보호 및 안전 기준을 유지할 수 있는 방식으로 프로그램을 확장하는 방법을 평가하고 있습니다. 향후 연구를 위해 Anthropic Insights에 접근하고자 하는 연구자들을 위한 관심 표현 양식이 제공되고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch