OpenAI Zero Data Retention 및 Private Safety Processing
OpenAI는 Zero Data Retention (ZDR) 약속을 유지하면서 여러 상호작용 전반에 걸쳐 안전 위험 및 오용 패턴을 식별하도록 설계된 새로운 시스템인 Private Safety Processing을 발표했습니다. 이를 통해 적격 API 고객은 자동화된 안전 집행을 가능적으로 하면서도, 자신의 프롬프트와 모델 응답이 OpenAI 직원들에 의해 보관되거나 검토되지 않도록 보장할 수 있습니다.
Zero Data Retention (ZDR) 프레임워크
Zero Data Retention은 적격 API 고객에게 요청이 처리된 후 OpenAI가 프롬프트나 모델 응답을 보관하지 않는다는 보장을 제공합니다. 이 프레임워크 하에서 고객 콘텐츠는 OpenAI 직원에 의한 검토를 위해 사용할 수 없으며, 고객이 명시적으로 옵트인(opt-in)하지 않는 한 기업 데이터는 모델 학습에 사용되지 않습니다.
진화하는 안전 시스템의 필요성
전통적인 ZDR 호환 안전 시스템은 상호작용을 개별 단위로 평가합니다. 그러나 OpenAI는 가장 심각한 AI 안전 위험은 종로종종 여러 상호작용을 함께 볼 때만 가시화된다고 밝히고 있습니다. 이러한 위험의 예는 다음과 같습니다:
- 패턴 기반 오용: 보호 조치를 탐색하거나 여러 계정에 걸쳐 조율하는 악의적인 행위자.
- 에이전트 정렬 불량 (Agentic misalignment): 복잡하고 다단계인 작업 중에 중단 명령을 받은 후에도 시스템이 계속해서 행동을 이어가는 경우.
- 위장된 위협: 일상적인 연구로 위장된 유해한 의도.
AI 모델이 더 길고 복잡한 작업을 처리함에 따라, 정당한 활동과 오용을 구별하는 능력은 단일 상호작용이 제공하는 것보다 더 넓은 문맥을 필요로 합니다.
Private Safety Processing의 기술적 구현
Private Safety Processing은 콘텐츠를 OpenAI 직원에게 노출하지 않으면서 관련 상호작용 전반에 걸쳐 자동화된 보호 기능을 확장하여 오용 패턴을 식별합니다. 이 시스템은 두 가지 주요 인프라 모델 하에서 작동합니다:
- 고객 제어 인프라: 콘텐츠는 고객이 관리하는 인프라에 머무릅니다.
- OpenAI 제공 스토리지: 콘텐츠는 OpenAI 인프라에 저장되지만, 고객이 독점적으로 제어하는 키로 암호화됩니다. OpenAI 직원은 이러한 키를 보유하지 않으며 기본 콘텐츠에 접근할 수 없습니다.
자동화된 시스템이 위험을 식별하면, 활동 유형을 나타내는 좁게 정의된 신호를 생성합니다. 이 신호는 집행이 필요한지 여부를 결정하는 데 사용되지만, OpenAI 직원은 콘텐츠가 플래그(flagged)된 경우에도 고객 콘텐츠에 대한 접근 권한을 받지 않습니다.
고객 제어 및 집행
고객은 자신의 데이터와 경고(alert) 조사에 대해 완전한 제어권을 유지합니다. 만약 고객이 집행 결정에 대해 항소하거나, 정당한 활동을 명확히 하거나, 확인된 남용을 조사하는 데 지원하고자 한다면, 관련 정보를 OpenAI에 자발적으로 공유할 수 있습니다.
가용성 및 로드맵
Private Safety Processing은 현재 초기 고객들을 대상으로 테스트 중입니다. OpenAI는 2026년 9월에 이 기능을 출시하고 기술 백서를 발행할 계획입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch