meridianlabs-ai/inspect_petri
An alignment auditing agent capable of quickly exploring alignment hypothesis
해결하는 문제
언어 모델의 감사를 자동화하여 정렬(alignment) 문제, 보상 해킹 및 기타 문제가 되는 동작을 찾아냅니다. 연구자는 상호작용을 시뮬레이션하고 모델 응답을 모니터링함으로써 특정 정렬 가설을 테스트할 수 있습니다.
작동 방식
Petri는 에이전트 시스템을 사용하여 감사를 수행합니다. 시드 지침을 받아 현실적인 감사 시나리오를 생성한 다음, 감사 모델과 대상 모델 간의 멀티턴 대화를 조율합니다. 동작을 추가로 테스트하기 위해 도구 시뮬레이션 및 롤백을 수행할 수 있습니다. 마지막으로 심사 모델이 일관된 루브릭을 사용하여 결과 트랜스크립트에 점수를 매깁니다.
대상
모델 정렬 및 행동 감사를 위한 엔드 투 엔드 테스트가 필요한 AI 안전 연구자 및 개발자.
주요 특징
- 시드 지침을 통한 감사 시나리오의 자동 생성
- 감사 모델과 대상 모델 간의 멀티턴 조율
- 모델 반응 테스트를 위한 도구 시뮬레이션 및 롤백 지원
- 심사 모델을 통한 루브릭 기반 트랜스크립트 점수 산정
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트