Anthropic와 Accenture, 프론티어 AI를 위한 내장 평가 파트너십 체결
Anthropic는 독립 평가자가 AI 회사 내부에서 안전 약속을 검증하고 모델 개발을 평가할 수 있도록 하는 '내장 평가(Embedded Evaluation)'를 구현하기 위해 Accenture와 파트너십을 체결했다. 이 파트너십은 외부 전문가가 훈련 과정과 내부 의사결정에 직원 수준의 접근 권한을 부여받음으로써 AI 안전성의 검증 가능성을 높이는 것을 목표로 한다.
내장 평가 모델
내장 평가는 전통적인 외부 평가와 달리 독립 평가자에게 직원 수준의 접근 권한을 부여한다. 이 내부적 관점은 평가자들이 다음과 같은 일을 할 수 있게 한다:
모델 개발 모니터링: 훈련 단계에서 모델이 어떻게 형성되는지 관찰한다.
내부 거버넌스 감사: 모델이 어떻게 구축되고 배포되는지를 규제하는 결정을 추적한다.
직접 직원 소통: 직원들과 직접 대화하여 맹점과 운영 안전성을 평가한다.
공개 보고: 사고를 보고하고, 모델과 관련된 위험과 이점에 대해 대중에게 더 잘 이해할 수 있는 정보를 제공한다.
Anthropic는 이러한 평가자들이 검증을 제공하지만, 모델 안전성에 대한 최종 책임은 AI 개발자에게 있음을 강조한다.
파트너십 범위 및 투자
이 파트너십은 Accenture의 전문 AI 사업인 Faculty가 주도한다. 업무 범위에는 모델 평가 및 레드팀 작업, 일치성 평가, 모델 보호 장치 테스트가 포함된다. Accenture가 다양한 산업과 정부에서 AI를 구현한 경험은 이러한 평가 과정에서 사용되는 안전 접근 방식에 영향을 줄 것으로 기대된다.
Anthropic와 Accenture는 향후 5년간 각각 최소 10억 달러를 투자하여 이 분야의 역량을 구축할 예정이다.
자금 조달 및 표준화 과제
현재 내장 평가자에 대한 정보 접근 및 보고 기준이 확립되어 있지 않으며, 자금 조달 시스템도 정착되지 않았기 때문에, 현재의 배치는 다음과 같다:
직접 자금 지원: 이 이니셔티브의 중요성과 시급성으로 인해 Anthropic가 Accenture의 업무를 직접 자금 지원한다.
대안 자금 지원 시범 프로젝트: Anthropic는 METR 및 기타 비영리 평가자들과 대화 중이며, 자체 독립적 자금을 사용한 내장 평가 시범 프로젝트를 진행할 예정이다.
장기적 목표: Anthropic는 6월에 발표한 고급 AI 프레임워크에서 제안한 바와 같이, 결국 자금 조달이 통합 또는 정부 출처에서 이루어지기를 주장한다.
생태계 및 비독점성
이 파트너십은 비독점적이다. Anthropic는 향후 몇 주 내에 더 많은 평가 기관과 협력할 계획이며, Accenture도 유사한 역할로 다른 AI 개발자들과 협력할 예정이다. 목표는 프론티어 AI 분야가 성숙함에 따라 공통 기준을 따르는 평가자 생태계를 구축하는 것이다.