OpenAI Model Spec: 명시적 모델 행동을 위한 프레임워크

OpenAI는 AI 모델이 지시를 따르고, 갈등을 해결하며, 안전하게 행동하도록 정의하는 공식 프레임워크인 Model Spec에 대한 접근 방식을 자세히 설명했습니다. Model Spec는 의도된 모델 행동에 대한 공개 목표 역할을 하여 OpenAI가 시스템을 훈련, 평가 및 개선할 수 있게 하며, 공개 토론과 비판을 위한 투명한 기준점을 제공합니다.

Model Spec를 공개 행동 프레임워크로서

Model Spec는 모델 행동을 암묵적인 훈련 과정에서 명시적이고 읽을 수 있는 문서로 옮기도록 설계되었습니다. 이는 내부 개발을 위한 "북극성" 역할을 하며, 외부 이해관계자들이 AI 응답을 규정하는 절충과 규칙을 이해할 수 있는 공개 참고 자료가 됩니다.

이 프레임워크는 OpenAI의 보다 넓은 안전 생태계의 일부로, 최첨단 능력 위험에 초점을 맞춘 Preparedness Framework와 AGI에 대한 사회적 적응을 다루는 AI 회복력 이니셔티브를 보완합니다. 행동 기대치를 공개함으로써 OpenAI는 공정성을 향상시키고(사용자가 편향된 대우를 식별하고 질문할 수 있게 함) 안전성을 강화하여, 유능한 시스템이 어떻게 행동해야 하는지에 대한 명확한 기대치를 제공합니다.

Model Spec의 구조적 구성 요소

AI 상호작용의 다양성을 다루기 위해 Model Spec는 단순한 규칙 목록 대신 여러 단계의 지침을 사용합니다:

고수준 의도와 공개 약속

프레임워크는 세 가지 시스템 수준 목표를 개요하는 서문으로 시작합니다: 사용자를 강화하기 위해 모델을 반복적으로 배포하고, 심각한 피해를 방지하며, OpenAI의 운영 라이선스를 유지하는 것. 이러한 목표는 Spec 내 모호성을 해결하는 데 지침이 되지만 모델에 대한 자율적인 지시는 아닙니다. 또한 Spec에는 "Red-line principles"와 같은 공개 약속이 포함되어 있어, OpenAI가 1차 배포에서 객관성을 유지하고 수익이나 체류 시간에 맞춰 응답을 최적화하지 않겠다는 약속을 명시합니다.

명령 체계

명령 체계는 OpenAI, 개발자 및 사용자로부터 오는 상충되는 지시를 해결하는 핵심 메커니즘입니다. 지시는 두 가지 주요 유형으로 구분됩니다:

  • Hard Rules: 재앙적인 위험, 직접적인 신체적 해악, 혹은 불법 행위를 방지하는 비가역적인 경계(루트 또는 시스템 수준)입니다. 여기에는 "Stay in bounds"와 "Under-18 Principles" 섹션이 포함됩니다.
  • Defaults: 선호가 지정되지 않았을 때 예측 가능한 행동을 보장하는 가변적인 시작점입니다. 여기에는 가이드라인 수준 기본값(톤과 스타일)과 사용자 수준 기본값(진실성 및 객관성)이 포함되며, 후자는 투명성을 보장하기 위해 명시적인 지시가 있어야만 재정의될 수 있습니다.

해석 보조 도구

“회색 영역”을 해결하기 위해 Spec는 다음을 활용합니다:

  • Decision Rubrics: 상충되는 목표를 균형 있게 조정하기 위한 프레임워크로, 예를 들어 작업을 효과적으로 수행하면서 되돌릴 수 없는 행동을 최소화합니다.
  • Concrete Examples: 준수 행동과 비준수 행동을 보여주는 프롬프트와 응답 쌍으로, 결정 경계를 명확히 합니다.

구현 및 거버넌스

OpenAI는 Model Spec가 인터페이스 (모델이 해야 할 일)이며 구현 (훈련 방식)이 아니라는 점을 명확히 합니다. 이는 모델의 행동을 설명하는 것이며, 전체 제품의 기능이나 사용 정책을 설명하는 것이 아닙니다.

지능과 명시적 규칙의 역할

OpenAI는 지능만으로는 가치가 얽힌 결정을 해결할 수 없다고 주장합니다. 모델이 수학 문제를 자율적으로 해결할 수 있더라도 “친절함과 안전성”은 상황에 따라 달라지며 인간이 정의한 가치 판단이 필요합니다. 명시적 규칙은 이러한 결정을 모델에 전적으로 맡기는 것을 방지하고, 인간의 논의와 수정 메커니즘을 제공합니다.

개발 및 반복

Spec는 연구, 안전, 정책, 법무 팀이 참여하는 교차 기능 내부 프로세스를 통해 개발되며, 공개 피드백과 민주적 의견을 바탕으로 반복됩니다. OpenAI는 Spec가 “현실적으로 야심찬” 목표가 되기를 바라며, 일반적으로 현재 모델 능력보다 0~3개월 앞선 행동을 목표로 합니다.

정렬 측정 및 격차 식별

훈련이 Spec 업데이트보다 뒤처지거나 의도치 않은 일반화를 초래할 수 있기 때문에, OpenAI는 시나리오 기반 평가 스위트인 Model Spec Evals를 출시했습니다. 이 스위트는 실제 모델 행동과 Spec의 주장 사이의 정렬을 추적합니다.

Spec 업데이트는 일반적으로 다음에 의해 추진됩니다:

  • 공개 이슈 및 실패 모드.
  • 테스트 중 발견된 내부 모호성.
  • 고수준 안전 정책의 변화.
  • 멀티모달 상호작용 및 자율 에이전트와 같은 새로운 능력의 등장.

Spec 내용 설계 원칙

프레임워크가 실행 가능하도록 보장하기 위해 OpenAI는 여러 작성 원칙을 따릅니다:

  • Clarity and Precision: 모호한 언어를 피하고 갈등을 해결하는 명시적 지침을 제공함(예: 따뜻함을 위해 “흰 거짓말”보다 진실성을 우선시함).
  • Substantive Rules: 규칙이 충분히 명확하여 서로 다른 독자들이 응답이 준수하는지 여부에 동의할 수 있도록 함.
  • High Signal-to-Noise Examples: 가장 어려운 갈등과 결정 경계를 강조하는 예시를 사용함.

Sources