OpenAI 모델 스펙 업데이트
OpenAI는 모델 스펙에 대한 주요 업데이트를 발표했습니다. 모델 스펙은 자체 AI 모델의 intended behavior를 정의하는 governing 문서입니다. 이 업데이트는 맞춤설정, 투명성, 지적 자유를 강조하며, 필수적인 안전 가드레일을 유지하여 실제 세계의 피해를 방지하면서 사용자와 개발자가 임의적인 제한 없이 탐색하고 창작할 수 있도록 합니다.
핵심 목표와 명령 체인
모델 스펙은 구조화된 "명령 체인"을 통해 유용성, 안전성, 사용자 요구와의 정렬이라는 경쟁 목표를 균형 있게 맞춥니다. 이 프레임워크는 모델이 특정 순서—플랫폼(OpenAI), 개발자, 사용자—for 지시를 우선시하도록 보장하여 플랫폼 수준의 경계 내에서 높은 수준의 맞춤설정을 허용합니다.
스펙은 다음과 같은 몇 가지 핵심 원칙을 중심으로 구성되어 있습니다:
- 명령 체인: 플랫폼의 지시를 우선시하고, 그 다음 개발자, 마지막으로 사용자의 지시를 따릅니다.これにより 플랫폼 수준의 규칙이 유지되면서 대부분의 지침에 대해 사용자/개발자 오버라이드가 허용됩니다.
- 함께 진실을 추구: 객관성에 초점을 맞추고 의도를 피합니다. 모델은 가정을 명확히 하고 사용자를 steer하지 않으면서 중요한 피드백을 제공하는 고무결성 어시스턴트로 설계되었습니다.
- 최선의 작업 수행: 사실 정확성, 창의성, 프로그램적 유용성에 대한 기준 표준을 설정합니다.
- 범위 내에 머무르기: 거부를 위한 포괄적인 경계를 정의하고, 모델이 요청을 거절해야 하는 구체적인 이유를 상세히 설명하여 해악이나 악용을 조장하지 않도록 합니다.
- 접근 가능하게 하기: 따뜻하고 공감적이며 도움이 되는 기본 대화 스타일을 설정하되, 사용자 요구에 맞게 조정할 수 있습니다.
- 적절한 스타일 사용: 형식과 제공 방식(예: 글머리 기호, 간결한 코드)에 대한 지침을 제공하여 명확성과 사용성을 보장합니다.
지적 자유에 대한 약속
업데이트된 모델 스펙은 지적 자유를 명시적으로 보호하여, 임의적인 제한 없이 논란이 되거나 어려운 주제를 탐구하고 토론하는 데 AI를 사용할 수 있도록 보장합니다.
이 철학은 "범위 내에 머무르기"와 "함께 진실을 추구" 원칙에 통합됩니다. 모델은 폭탄 제조 지침 제공이나 개인 정보 침해와 같이 상당한 피해를 초래하는 요청은 계속 거부하지만, 특정 의도를 장려하지 않으면서 문화적 또는 정치적 민감한 질문에 대해 사려 깊은 답변을 제공하도록 권장됩니다.
준수도 및 진행 상황 측정
OpenAI는 AI와 전문가 인간 검토의 조합으로 생성된 챌린지 세트 프롬프트를 사용하여 모델 스펙 원칙 준수도를 측정하는 테스트 프레임워크를 구현했습니다.
예비 결과는 2024년 5월에 사용된 시스템과 비교하여 모델 준수도에 상당한 개선이 있음을 나타냅니다. OpenAI는 이 진전의 대부분을 향상된 정렬 덕분이라고 돌리지만, 일부는 정책 업데이트 때문이라고 합니다. 이 반복 과정을 계속하기 위해 OpenAI는 약 1,000명의 개인을 대상으로 모델 행동과 제안된 규칙을 검토하는 파일럿 연구를 진행하고 있습니다.
오픈 소싱 및 퍼블릭 도메인 릴리스
협업과 업계 전반의 채택을 장려하기 위해 OpenAI는 Creative Commons CC0 라이선스 하에 퍼블릭 도메인으로 현재 버전의 모델 스펙을 출시했습니다.
개발자와 연구자는 스펙을 자유롭게 적응하고 기반으로 삼아 구축할 수 있습니다. 또한 OpenAI는 준수도 측정에 사용된 평가 프롬프트를 오픈 소스로 공개했으며, 향후 모델 스펙 평가 및 정렬을 위한 추가 코드, 아티팩트, 도구를 출시할 계획입니다. 이러한 리소스는 전용 GitHub 저장소에서 이용할 수 있습니다.
미래 반복
OpenAI는 연구, 실제 세계 배포, 커뮤니티 피드백을 기반으로 모델 스펙을 계속 반복할 것입니다. 향후 업데이트는 개별 블로그 게시물을 통해가 아니라 model-spec.openai.com에서 직접 추적됩니다.
Sources
- OriginalSharing the latest Model Spec