Anthropic, Petri 정렬 도구를 Meridian Labs에 기부
Anthropic은 오픈소스 정렬 도구인 Petri의 개발을 비영리기관인 Meridian Labs에 이관하고, 도구의 3.0 버전을 공개했다. 이 조치는 정렬 테스트 프레임워크가 특정 AI 연구소에 종속되지 않도록 하여 산업 전반에서 대규모 언어 모델(LLM)에 대한 중립적이고 신뢰할 수 있는 평가를 촉진한다.
Petri 3.0 기술적 개선사항
Petri 3.0은 정렬 테스트의 정확성과 활용도를 높이기 위해 세 가지 주요 아키텍처 및 기능 개선을 도입했다.
더 높은 적응성
Petri 3.0은 감사 모델과 대상 모델을 분리하는 주요 아키텍처 변경을 포함한다. 이 분리는 각 구성 요소를 독립적으로 조정하고 수정할 수 있게 하여, 더 다양한 사용 사례에 적응할 수 있도록 도와준다.
"Dish"를 통한 현실성 향상
모델이 테스트 중임을 인지하는 것을 방지하기 위해(이는 일반적인 성능을 반영하지 않는 행동으로 이어질 수 있음), Anthropic은 "Dish"라는 추가 기능을 도입했다. Dish는 실제 시스템 프롬프트와 실제 "스카프홀드"(모델의 목표 달성에 도움을 주는 소프트웨어 래퍼)를 사용함으로써 테스트 환경의 현실성을 높인다.
Bloom 통합을 통한 깊이 있는 행동 평가
Petri는 이제 Anthropic의 또 다른 오픈소스 정렬 도구인 Bloom과 통합되었다. Petri는 광범위한 평가를 제공하지만, Bloom과의 통합을 통해 연구자들은 특정 선택된 행동에 대해 더 깊이 있는 평가를 수행할 수 있다.
운영 프레임워크 및 사용 사례
Petri는 별도의 "감사 모델"을 사용하여 정렬과 관련된 시나리오를 시뮬레이션한다. 이후 "심사 모델"이 결과 전사본을 평가하여 정렬되지 않은 행동을 식별한다. 이 도구는 다음과 같은 우려되는 경향을 탐지하도록 특별히 설계되었다:
- 속임수
- 아첨
- 해로운 요청과의 협력
Anthropic은 Claude Sonnet 4.5부터 모든 Claude 모델의 정렬 평가 과정에 Petri를 통합했다. 또한, 영국의 AI 보안 연구소(AISI)는 Petri를 모델이 AI 연구를 방해할 가능성을 평가하는 핵심 구성 요소로 활용했다.
Meridian Labs로의 이관
Anthropic은 Petri의 개발을 AI 평가 비영리기관인 Meridian Labs에 이관했다. 이 이관은 Anthropic이 Model Context Protocol(MCP)을 Linux Foundation에 기부한 것과 유사한 패턴을 따르고 있다. Petri를 비영리 기관으로 이관함으로써, 이 도구는 Inspect와 Scout와 같은 다른 도구들과 함께, 연구소, 독립 연구자, 정부 등이 신뢰할 수 있고 중립적인 AI 모델 행동 테스트를 수행할 수 있도록 하는 점점 커지고 있는 오픈 기술 스택에 포함된다.
Sources
관련
- Dispatch
- Dispatch
- 프로젝트
- Dispatch
- Dispatch