OpenAI Voice Engine: 기술 구현 및 안전 프레임워크
OpenAI는 맞춤형 음성을 만들 수 있는 합성 음성 기술인 Voice Engine을 개발했습니다. 이 기술은 ChatGPT의 Voice Mode와 Text-to-Speech (TTS) API에 통합되었으며, 합성 오디오와 관련된 위험을 완화하기 위해 통제된 반복적 프레임워크를 통해 보다 넓은 배포가 관리되었습니다.
기술 배포 및 제품 통합
Voice Engine은 2023년 9월 이후 세 가지 주요 제품 구현에 활용되었습니다:
- ChatGPT Voice Mode: 2023년 9월에 출시된 이 기능은 2023년 5월부터 시작된 전문 성우, 재능 에이전시, 업계 고문과의 과정을 통해 신중히 선택된 실제 음성만을 사용하여 만든 음성을 사용합니다.
- TTS API: 2023년 11월에 출시된 이 API는 6개의 사전 설정 음성을 제공합니다. 각 음성은 전문 성우의 15초 오디오 샘플을 사용하여 제작되었습니다.
- Custom Voice Previews: 2024년 3월에 OpenAI는 신뢰할 수 있는 소수 파트너와 함께 맞춤형 음성을 생성하는 기능을 미리 보여주어 합성 음성 기술의 위험과 기회를 탐색했습니다.
안전 연구 및 정책 목표
OpenAI는 정책 입안자와 대중이 합성 음성의 위험을 이해하도록 돕기 위해 반복적인 배포 프레임워크를 활용합니다. 2022년 말에 개발된 초기 내부 프로토타입(공개 및 비공개 음성 샘플을 혼합하여 내부 테스트에만 사용)은 2023년 여름부터 전 세계 정책 입안자에게 기술의 잠재력을 보여주는 데 사용되었습니다.
맞춤형 음성 기능에 대한 제한된 파트너 미리보기를 통해 OpenAI는 다음과 같은 보안 및 정책 목표를 달성하고자 합니다:
- 음성 기반 인증 단계적 폐지: 은행 계좌와 같은 민감한 정보에 접근하기 위한 보안 수단으로서 음성에 대한 의존도를 줄이는 것.
- 개인 음성 보호: AI에서 개인의 음성 사용을 보호하기 위한 정책을 탐색하는 것.
- 공공 교육: 기만적인 콘텐츠 가능성을 포함한 AI의 능력과 한계에 대해 대중을 교육하는 것.
- 콘텐츠 출처: AI 생성 오디오와 실제 인간 음성을 구분하기 위해 시청각 콘텐츠의 출처를 추적하는 기술 도입을 가속화하는 것.
내부 테스트 및 정렬
Voice Engine의 내부 프로토타입은 안전 장치 개발을 위한 정렬 및 안전 연구에만 독점적으로 사용되었습니다. OpenAI는 이러한 초기 내부 테스트의 결과물이 내부 테스트에만 사용되었으며, 공개 제품을 구동하는 모델을 학습시키는 데 사용되지 않았다고 명시합니다.
SUMMARY: OpenAI의 Voice Engine은 2022년부터 개발된 합성 음성 모델로, 안전 연구 및 정책 개발에 정보를 제공하기 위해 통제된 릴리스를 통해 반복적으로 배포되었습니다.
TITLE: OpenAI Voice Engine: 기술 구현 및 안전 프레임워크