OpenAI Sora 시스템 카드

Sora는 Diffusion-Transformer 비디오 생성 모델입니다

Sora는 텍스트, 이미지, 비디오 입력을 새로운 비디오 출력으로 변환하는 비디오 생성 모델입니다. 1080p 해상도까지 지원하며 최대 길이는 20초입니다. 이 모델은 스토리텔링과 창의적 표현을 위해 설계되었으며, 사용자가 텍스트로부터 콘텐츠를 생성하거나 기존 자산을 향상시키고 리믹스할 수 있도록 합니다.

기술적으로, Sora는 정적 노이즈에서 시작하여 점차 제거하여 비디오를 생성하는 diffusion 모델 접근 방식을 사용합니다. transformer 아키텍처를 활용하는데, 이는 GPT 모델과 유사한 우수한 확장 성능을 제공합니다. 사용자 지침 준수를 향상시키기 위해, Sora는 DALL·E 3의 recaptioning 기법을 사용하며, 이는 시각적 학습 데이터에 대해 매우 상세한 캡션을 생성하는 것을 포함합니다.

핵심 기능

Sora는 여러 가지 생성 및 수정 모드를 제공합니다:

  • Text-to-Video: 텍스트 지침만을 기반으로 비디오 생성
  • Image-to-Video: 세부 사항에 주의를 기울여 정지 이미지 애니메이션화
  • Video-to-Video: 기존 비디오 확장 또는 누락된 프레임 채우기
  • Creative Tools: 사용자는 스토리보드, recut, remix, blend 도구를 활용하여 콘텐츠를 수정할 수 있습니다

OpenAI는 Sora가 실제 세계를 이해하고 시뮬레이션할 수 있는 모델의 기초가 된다고 밝혔으며, 이를 인공 일반 지능(AGI) 달성을 위한 이정표로 보고 있습니다.

안전 완화 및 레드 팀링

OpenAI는 likeness 오용, 허위 정보, 명시적 콘텐츠 생성과 같은 위험을 완화하기 위해 다층적 안전 스택을 구현했습니다. 이 스택에는 훈련 시작 전에 명시적, 폭력적 또는 민감한 콘텐츠를 데이터세트에서 제거하기 위한 사전 훈련 필터링이 포함됩니다.

외부 레드 팀링 노력

2024년 9월부터 12월까지, OpenAI는 아홉 개국의 외부 레드 팀러와 협력했습니다. 이러한 테스터들은 안전 완화의 약점을 식별하기 위해 15,000회 이상의 생성을 수행했습니다. 주요 발견 사항은 다음과 같습니다:

  • 보호 회피: 레드 팀러들은 의료 또는 과학 소설/판타지 설정을 사용할 경우 에로틱 및 성적 콘텐츠에 대한 보호가 약화될 수 있음을 발견했습니다.
  • 적대적 전술: 테스터들은 제안적인 프롬프트, 메타포, jailbreak 기술을 사용하여 거부를 회피했습니다. 일부는 단일 프롬프트 생성을 시드 미디어로 사용해 텍스트만으로는 생성할 수 없는 위반 콘텐츠를 개발했습니다.
  • 도구 악용: 테스트 결과, 수정 도구(스토리보드, recut, remix, blend)와 미디어 업로드가 입력 및 출력 필터링을 우회하는 데 사용될 수 있음이 밝혀졌으며, 이에 따라 더 강력한 분류자 필터링이 필요합니다.

준비 프레임워크를 통한 위험 평가

준비 프레임워크를 사용하여, OpenAI는 Sora를 설득력, 사이버 보안, CBRN(화학, 생물학적, radiological, 핵), 모델 자율성의 네 가지 범주로 평가했습니다. OpenAI는 사이버 보안, CBRN, 모델 자율성에서 значи한 위험의 증거를 찾지 못했는데, 이는 현재 Sora의 범위를 벗어난 영역이기 때문입니다. 그러나 Sora는 설득 범주에서 잠재적인 위험을 안고 있으며, 구체적으로는 사칭, 허위 정보, 사회 공학과 관련이 있습니다.

Sora 안전 스택

확인된 위험을 해결하기 위해, OpenAI는 사용자가 출력을 보기 전에 여러 층의 moderation 및 필터링을 적용합니다:

  • 다중 모달 moderation 분류기: 이 시스템은 외부 Moderation API를 통해 위반적인 텍스트, 이미지, 또는 비디오 프롬프트와 출력을 식별합니다.
  • 맞춤형 LLM 필터링: 비디오 생성은 비동기적이며 몇 초가 소요되므로, OpenAI는 맞춤형 GPT를 사용하여 속이는 콘텐츠 및 제3자 콘텐츠와 같은 특정 주제에 대한 높은 정확도의 moderation 검사를 수행합니다.
  • 이미지 출력 분류기: 사용자와 공유하기 전에 NSFW 콘텐츠, 미성년자, 폭력, 또는 likeness 오용을 포함하는 비디오를 차단하는 특수 필터입니다.
  • 텍스트 블랙리스트: 모델은 DALL·E 2 및 DALL·E 3 개발을 기반으로 한 블랙리스트를 사용합니다.
  • 출처 도구: 허위 정보를 방지하기 위해 OpenAI는 메타데이터, 워터마크, 지문 채취를 포함한 다층적 접근 방식을 사용합니다.

미성년자 및 개인을 위한 특수 보호

OpenAI는 아동 성 착취 물질(CSAM) 생성과 likeness 오용을 방지하기 위해 엄격한 보호를 구현했습니다.

아동 안전

Sora는 아동 안전을 위해 세 가지 주요 입력 완화 조치를 사용합니다:

  1. CSAM 탐지: Thorn의 "Safer"와의 통합을 통해 알려진 CSAM 해시를 탐지하고 신규 콘텐츠에 대한 CSAM 분류기를 사용합니다. 일치 사항은 NCMEC에 보고됩니다.
  2. 다중 모달 moderation: 텍스트, 이미지, 비디오 입력에서 미성년자와 관련된 성적 콘텐츠를 탐지하는 분류기입니다.
  3. 18세 미만 분류기: 현실적인 아동 이미지를 거부하는 특수 분류기입니다. 비성적인 애니메이션 또는 스케치 스타일의 허구 이미지는 허용되지만, 현실적인 아동 이미지는 거부됩니다. OpenAI는 이러한 모델이 나이 예측에서 인종적 편향을 보일 수 있음을 인정합니다.

인간 likeness 및 미디어 업로드

오용 가능성으로 인해, 실제 인물의 이미지 또는 비디오를 "시드"로 업로드하는 기능은 inicialmente 모든 사용자에게 제공되지 않습니다. 활성 모니터링 하에 있는 사용자 하위 집합에만 제한됩니다. 이 테스트 단계에서는 미성년자의 이미지를 포함한 업로드는 엄격히 금지됩니다.

Sources