ChatGPT 음성 및 이미지 기능 업데이트

OpenAI는 음성 및 이미지 기능을 ChatGPT에 통합하여 인터페이스를 텍스트 전용에서 멀티모달 경험으로 변환했습니다. 이 업데이트를 통해 사용자는 실시간 음성 대화를 나누고 모델이 분석하고 논의할 수 있는 시각적 입력을 제공할 수 있습니다.

음성 상호작용 기능

ChatGPT는 이제 양방향 음성 대화를 지원하여 사용자가 손을 쓰지 않고 어시스턴트와 상호작용할 수 있도록 합니다. 이 기능은 iOS 및 Android에서 'New Features' 메뉴의 선택 설정을 통해 이용할 수 있습니다.

음성 기술 구현

음성 경험은 두 가지 주요 기술의 조합으로 구동됩니다:

  • Text-to-Speech (TTS): 텍스트와 몇 초의 샘플 음성으로부터 인간과 유사한 오디오를 생성할 수 있는 새로운 모델입니다. 사용 가능한 목소리는 전문 성우와의 협업을 통해 만들어졌습니다.
  • Speech Recognition: OpenAI의 오픈소스 Whisper 시스템은 모델이 처리할 수 있도록 spoken words를 텍스트로 transcribe하는 데 사용됩니다.

이미지 이해 및 시각적 입력

사용자는 이제 하나 이상의 이미지를 ChatGPT에 제공하여 하드웨어 문제 해결, 식료품 저장소 내용을 기반으로 한 식사 계획, 복잡한 데이터 그래프 분석 등의 작업을 수행할 수 있습니다. 모바일 기기에서는 사용자가 이미지의 특정 부분에 모델의 주의를 집중하도록 도와주는 그림 그리기 도구를 사용할 수 있습니다.

멀티모달 모델 아키텍처

이미지 이해는 GPT-3.5와 GPT-4의 멀티모달 버전으로 구동됩니다. 이러한 모델은 사진, 스크린샷, 텍스트와 이미지가 결합된 문서 등 다양한 시각 형식에 언어 추론 기술을 적용합니다.

안전 및 배포 전략

OpenAI는 이러한 기능을 2주 기간 동안 Plus 및 Enterprise 사용자에게 점진적으로 배포하며, 나중에 개발자 및 기타 사용자 그룹에 대한 접근을 확대할 계획입니다. 이 단계적 배포는 위험 완화를 개선하고 사용자가 더 강력한 시스템을 준비하도록 의도되었습니다.

음성 안전 및 위험 완화

현실적인 합성 음성을 생성할 수 있는 기능이 사기나 사칭에 사용될 수 있기 때문에, OpenAI는 이 기술의 적용을 전문 배우가 만든 목소리를 사용하는 음성 채팅이라는 특정 사용 사례로 제한했습니다. ChatGPT 외부에서는 OpenAI가 Spotify와 같은 파트너와 협력하여 팟캐스터를 위한 음성 번역 기능을 시범 운영하고 있습니다.

시각 안전 및 개인정보 보호

사람에 대한 환각 또는 고위험 분야에서의 오용과 같은 위험을 해결하기 위해 OpenAI는 다음과 같은 조치를 시행했습니다:

  • Red Teaming: 모델은 과학적 전문성과 극단주의와 관련된 위험을 위해 레드 팀러와 알파 테스터에 의해 테스트되었습니다.
  • Privacy Restrictions: 개인정보 보호를 강화하고 정확성을 보장하기 위해 ChatGPT가 개인을 분석하고 직접적인 진술을 하는 능력을 크게 제한하는 기술적 조치가 시행되었습니다.
  • Accessibility Collaboration: 시각 기능 개발은 시각 장애 및 저시력자를 위한 앱인 Be My Eyes와의 협업 작업에 기반하여 정보를 얻었습니다.

모델 제한

OpenAI는 시각 기능에 대한 특정 제한 사항을 언급합니다:

  • Verification Required: 적절한 검증 없이 고위험 사용 사례에서 모델을 사용하는 것은 권장되지 않습니다.
  • Language Constraints: 모델은 영어 텍스트를 전사하는 데 능숙하지만, 특히 로마자가 아닌 문자를 사용하는 다른 언어에서는 성능이 낮습니다.

Sources