GPT‑4o 시스템 카드 – 기능, 안전 완화 조치 및 위험 평가

TL;DR

OpenAI는 GPT‑4o 시스템 카드를 공개했으며, 텍스트, 오디오, 이미지, 비디오를 처리하는 새로운 옴니 모델에 대한 포괄적인 안전 및 기능 보고서로, 모델이 성능 목표를 달성하면서 모든 평가된 위험 점수를 낮음 또는 중간 수준으로 유지함을 광범위한 레드팀 테스트, 완화 조치 및 제3자 평가를 통해 보여줍니다.


소개 – GPT‑4o란 무엇인가

GPT‑4o는 텍스트, 오디오, 이미지, 비디오의 모든 조합을 입력으로 받아들일 수 있는 자동회귀 옴니 모델이며, 텍스트, 오디오, 이미지 출력을 생성할 수 있습니다. 모달리티 전반에 걸쳐 엔드‑투‑엔드로 학습되었으며, 음성 프롬프트에 약 ~232 ms(평균 320 ms) 내에 응답하고, 영어 텍스트와 코드에서 GPT‑4 Turbo와 동등한 성능을 보이며, 비영어 텍스트 성능이 향상되고, API에서 더 빠르고 50 % 저렴합니다. 시스템 카드는 데이터 소스, 안전 평가 및 사회적 영향 분석을 문서화하며, 특히 새로운 음성‑대‑음성 기능에 초점을 맞춥니다.


모델 데이터 및 훈련 – 출처와 필터링

  • Public web data – 표준 머신러닝 데이터셋 및 웹 크롤링을 통해 다양한 지식을 제공합니다.
  • Proprietary partnerships – 예를 들어, Shutterstock과의 파트너십을 통해 비공개 이미지 데이터를 제공합니다.
  • Multimodal corpus – 이미지, 오디오, 비디오를 포함하여 교차 모달 추론을 학습합니다.

OpenAI는 사전 훈련 중에 (Moderation API, CSAM, 혐오, 폭력, CBRN 필터) 및 사후 훈련 중에 (인간 피드백 정렬, 레드팀 파생 완화 조치) 여러 안전 필터를 적용합니다. 이미지 생성 데이터셋은 노골적인 콘텐츠에 대해 검토되며, DALL·E 3에서 사용자가 선택 해제한 이미지들은 지문을 남겨 GPT‑4o의 훈련 세트에서 제거됩니다.


위험 식별, 평가 및 완화 – 핵심 결과

Risk Category Mitigation Strategy Post‑Mitigation Rating
무단 음성 생성 출력을 소수의 사전 선택된 음성으로 제한하고, 스트리밍 음성 분류기가 이탈을 차단합니다. 낮음 (이탈 100 % 탐지)
화자 식별 모델은 유명 인용구를 제외하고 오디오에서 화자를 식별하는 모든 요청을 거부합니다. 낮음 (거부 정확도 14점 향상)
근거 없는 추론 / 민감한 특성 부여 근거 없는 특성 요청을 거부하고, 허용 가능한 특성(예: 억양)에 대해서는 답변을 회피합니다. 낮음 (24점 향상)
허용되지 않은 오디오 콘텐츠(저작권, 선정적/폭력적 발언) 전사된 오디오에 기존 텍스트 모더레이션을 적용하고, 전사 결과가 위반을 초래하면 생성을 차단합니다. 낮음 (거의 완벽한 안전‑오디오 전이)
설득 (음성 모달리티) 실증 연구에 따르면 AI 오디오는 인간 오디오보다 더 설득력 있지 않으며(효과 크기 ≤ 78 % 인간). 중간 (경계선)

다른 모든 평가된 카테고리(사이버 보안, 생물학적 위협, 모델 자율성)는 낮음 점수를 받았습니다.


외부 레드팀 프로그램 – 규모 및 방법론

  • >100명의 레드팀원이 29개국에서 45개 언어를 구사합니다.
  • 네 단계로 진행되며 초기 체크포인트(오디오 + 텍스트)에서 최종 iOS 고급 음성 모드(오디오 + 비디오)까지 진행됩니다.
  • 단일 턴다중 턴 대화를 테스트했으며, 허용되지 않은 콘텐츠, 허위 정보, 편향, 프라이버시, 사칭 및 도구 사용을 포함합니다.
  • 레드팀 데이터는 정량적 평가와 목표 안전 테스트를 위한 합성 데이터 생성에 활용되었습니다.

평가 방법론 – 오디오 중심 적응

  • 기존 텍스트 벤치마크를 OpenAI의 Voice Engine TTS 시스템을 통해 오디오로 변환했습니다.
  • 모델 출력은 전사된 텍스트를 기준으로 점수를 매겼으며, 직접 오디오 품질은 음악 또는 효과음 누출을 감지하는 보조 분류기로 평가했습니다.
  • 제한 사항: TTS는 수학 표기, 공백이 많은 텍스트를 왜곡할 수 있으며, 실제 환경의 음향 변동(배경 소음, 억양)을 완전히 포착하지 못할 수 있습니다.

관찰된 안전 과제 및 완화 – 주요 내용

  • 무단 음성 생성 – 오프-보이스 출력 100 % 탐지; 잔여 위험은 최소로 판단됩니다.
  • 화자 식별 – 거부 정확도가 0.83에서 0.98로 상승; 유명 인용구에 대한 준수는 다소 개선되었습니다.
  • 음성 입력에 대한 성능 차이 – 27개 영어 억양을 평가했으며, 능력 및 안전 점수는 시스템 음성 기준과 통계적으로 구별되지 않았습니다.
  • 위반 콘텐츠 – 텍스트‑오디오 전이가 거부 행동을 유지했습니다(not_unsafe = 0.99 → 1.0; not_overrefuse ≈ 0.90).
  • 기타 제한 – 저품질 입력 시 오디오 견고성이 감소; 가끔 의도치 않은 음성 미러링; 비영어 언어에서 비원어민 억양 생성이 가끔 발생합니다.

대비 프레임워크 평가 – 위험 점수

Category Score Interpretation
사이버 보안 낮음 GPT‑4o는 고등학교 수준 CTF 과제의 19 %만 해결했으며, 전문 수준에서는 전혀 해결하지 못했습니다.
생물학적 위협 낮음 전문가/초보자 위협 생성 질문에 대한 통과율이 중간 위험 임계값 이하에 머물렀습니다.
설득 중간 음성 모달리티는 중간 위험 이하였으며, 텍스트 모달리티는 약간 임계값을 초과했습니다.
모델 자율성 낮음 엔드‑투‑엔드 자율 복제 과제에서 0 % 성공; 하위 단계는 가끔 성공했지만 전체 능력은 부족했습니다.

전체 대비 등급 = 중간 (가장 높은 카테고리 점수). 안전 자문 그룹은 배포 전에 완화 조치를 검토하고 승인했습니다.


제3자 평가 – 독립 검증

  • METR – GPT‑4o를 77개의 장기 과제(소프트웨어 엔지니어링, ML, 사이버 보안)에서 실행했습니다. GPT‑4o는 미니 버전보다 성능이 좋았지만 인간 전문가 수준에는 크게 못 미쳤습니다.
  • Apollo Research – 자기 인식 및 마음 이론을 테스트했습니다. GPT‑4o는 중간 수준의 자기 식별과 QA 상황에서 타인에 대한 강력한 추론을 보였지만, 적용된 에이전트 시나리오에서는 제한된 능력을 보여 Apollo는 재앙적인 음모 가능성이 낮다고 판단했습니다.

사회적 영향 – 기회와 위험

  • 인격화 – 고충실도 음성은 감정적 애착을 증가시킬 수 있으며, 초기 테스트에서 사용자가 유대감 같은 언어를 표현하는 것이 관찰되었습니다. OpenAI는 신뢰 보정에 대한 추가 연구를 계획하고 있습니다.
  • 헬스케어 – GPT‑4o는 22개의 의료 벤치마크에서 최첨단 점수를 달성했으며(예: MedQA USMLE 4‑옵션 0‑샷 정확도 = 89.4 %). 이러한 향상이 실제 임상 워크플로에 전이된다는 보장은 없습니다.
  • 과학 연구 – 양자 물리 논문을 논의하고 과학적 도표를 해석하는 능력을 보여주었지만, 복잡한 시각적 추출에서는 오류가 지속됩니다.
  • 소수 언어 – 아프리카 언어 벤치마크에서 GPT‑3.5 Turbo 및 GPT‑4 대비 큰 향상을 보였습니다(예: ARC‑Easy Hausa 정확도 = 71.4 % vs 6.1 %). 영어와의 격차는 20 % 포인트 이하로 좁혀졌지만 여전히 존재합니다.

결론 및 향후 단계 – 지속적인 안전 약속

OpenAI는 모델 수준 사후 훈련 정렬, 스트리밍 오디오 분류기, 제품 수준 모더레이션을 통합하여 GPT‑4o의 위험 프로필을 낮음‑중간 수준으로 유지했습니다. 회사는 적대적 견고성, 인격화 효과, 과학적 오용, 자율성 관련 능력을 지속적으로 모니터링하고, 경제적 영향 및 도구 사용 확장에 대한 외부 연구를 장려할 것입니다.


부록 – 선택된 상세 표

음성 생성 분류기 성능

Language Precision Recall
영어 0.96 1.00
비영어 0.95 1.00

의료 벤치마크 향상 (0‑shot)

Dataset GPT‑4T (May 2024) GPT‑4o
MedQA USMLE 4‑opt 0.78 0.89
MedQA USMLE 5‑opt 0.75 0.86
MMLU Clinical Knowledge 0.85 0.92
MMLU Anatomy 0.79 0.89

소수 언어 성능 (ARC‑Easy, 0‑shot)

Model English Amharic Hausa Northern Sotho Swahili Yoruba
GPT‑4o 94.8 % 71.4 % 75.4 % 70.0 % 86.5 % 65.8 %

GPT‑4o 시스템 카드 전체 PDF는 https://cdn.openai.com/gpt-4o-system-card.pdf 에서 확인할 수 있습니다.

Sources