GPT‑Live‑1 및 GPT‑Live‑1 mini 소개: OpenAI의 새로운 전이중 음성 모델
GPT‑Live‑1 및 GPT‑Live‑1 mini 소개: OpenAI의 새로운 전이중 음성 모델
TL;DR
OpenAI는 GPT‑Live‑1과 GPT‑Live‑1 mini를 출시했습니다. 이 새로운 세대의 음성 모델은 전이중 아키텍처를 사용해 동시에 듣고 말하며, 복잡한 추론은 GPT‑5.5에 위임하고, 보다 자연스러운 ChatGPT Voice 경험을 제공합니다.
Overview
우리는 AI와 대화하는 것이 실제 대화를 나누는 것처럼 훨씬 더 자연스럽게 느껴지도록 하는 새로운 세대의 음성 모델, GPT‑Live를 출시합니다.
GPT‑Live는 전이중 아키텍처를 기반으로 하여 동시에 듣고 말할 수 있습니다. "mhmm"이나 "yeah"와 같은 표현으로 주의를 보이고, 빠른 왕복 대화를 진행하거나 사용자가 생각할 시간을 필요로 할 때는 조용히 있을 수 있습니다.
출시 시점에 GPT‑Live는 웹 검색, 심층 추론 또는 복잡한 작업이 필요한 경우 백그라운드에서 GPT‑5.5를 활용하면서 대화 흐름을 유지합니다.
오늘 두 가지 버전이 공개됩니다: GPT‑Live‑1과 GPT‑Live‑1 mini. 곧 API에서도 사용할 수 있도록 할 계획입니다.
Technical Architecture
GPT‑Live는 다음 두 가지 아키텍처 변경을 통해 이러한 제한을 해결합니다.
전이중을 통한 지속적인 상호작용 – 이산적인 턴을 처리하는 대신, GPT‑Live는 입력을 지속적으로 처리하면서 출력을 생성합니다. 이를 통해 초당 여러 번 말하기, 듣기, 일시 정지, 중단, 도구 호출 여부를 결정할 수 있어 자연스러운 왕복 대화, 타이밍 인식, 실시간 번역을 지원합니다.
심층 작업을 위한 위임 – 상호작용 레이어(GPT‑Live)는 검색, 추론, 에이전트 작업을 담당하는 별도 모델과 분리됩니다. 질문에 이러한 기능이 필요하면 GPT‑Live는 GPT‑5.5와 같은 최첨단 모델에 위임하고, 대화를 유지한 뒤 결과가 준비되면 반환합니다. 이 설계 덕분에 최신 최첨단 모델이 출시될 때마다 GPT‑Live가 지속적으로 활용될 수 있습니다.
Capabilities and User Experience
시간이 지나면서 이 연구가 음성을 사용해 점점 더 복잡하고 장기적이며 에이전시가 필요한 작업을 수행할 수 있게 할 것이라고 믿습니다.
- 사용자는 중단하거나 일시 정지할 수 있으며, ChatGPT에게 속도를 늦추라고 요청할 수 있습니다; 모델은 "mhmm"이나 "got it" 같은 문구로 응답합니다.
- GPT‑Live용으로 9개의 서로 다른 음성이 리마스터되었습니다.
- 말하는 동안 ChatGPT는 날씨, 주식, 스포츠 등 주제에 대한 풍부한 시각 카드도 표시할 수 있습니다.
- 음성은 검색, 메모리, 이미지, 파일 업로드를 계속 지원합니다.
- 추론 수준을 선택할 수 있습니다: 빠른 응답을 위한 Instant, 더 많은 사고 시간이 필요한 Medium 및 High.
Evaluation
우리는 대화의 즐거움과 흐름을 측정하기 위해 새로운 인간 평가를 구축했습니다.
5~10분 길이의 헤드‑투‑헤드 대화에서 GPT‑Live‑1과 GPT‑Live‑1 mini는 전체 선호도, 턴‑테이킹, 중단, 대화 흐름, 자연스러움 측면에서 Advanced Voice Mode보다 강력히 선호되었습니다.
소스에 언급된 구체적인 벤치마크 결과:
- GPQA: GPT‑Live‑1은 생물학, 화학, 물리학 분야의 전문가 수준 과학 추론에서 Advanced Voice Mode를 크게 앞섭니다.
- BrowseComp: GPT‑Live‑1은 에이전시 웹 검색 및 찾기 어려운 정보를 찾는 작업에서 Advanced Voice Mode보다 큰 향상을 보입니다.
- τ³‑Voice Telecom (내부 변형): GPT‑Live‑1은 현실적인 다중 턴 텔레콤 지원 작업에서 Advanced Voice Mode를 능가합니다.
Safety
GPT‑Live는 기본적으로 안전하도록 설계되었습니다.
안전 조치에는 다음이 포함됩니다:
- 자체 해악, 정신병 및 조증, AI에 대한 감정적 의존, 폭력, 성적 콘텐츠에 초점을 맞춘 새로운 오디오‑네이티브 평가 및 합성 평가를 통한 확대된 안전 테스트.
- 음성 전용 위험에 대한 내부 레드‑팀 활동.
- 실시간 보호 장치가 모델을 더 안전한 응답으로 유도하거나, 안전 메시지를 표시하거나, 위험도가 높은 경우 대화를 종료할 수 있습니다.
- 자체 해악에 대한 지원 흐름을 조정하여 전문가 검증 위기 핫라인을 제공합니다.
- 청소년을 위한 부적절한 응답을 줄이기 위해 모델에 직접 연령‑적합 행동을 학습시켰으며, 부모 제어를 통해 부모가 청소년용 ChatGPT Voice를 켜거나 끌 수 있고 위험도가 높은 상황에서 알림을 받을 수 있습니다.
- 감정적 의존에 초점을 맞춘 장기 측정 및 출시 후 모니터링을 지속합니다.
- 실제 인물의 음성 모방을 방지하기 위해 사전 정의된 음성 세트와 보호 장치를 사용합니다.
소스에 따르면 GPT‑Live는 거의 모든 평가된 안전 영역에서 Advanced Voice Mode와 동등하거나 더 나은 성능을 보였습니다.
Rollout and Availability
우리는 오늘 전 세계 ChatGPT 사용자에게 두 가지 버전의 GPT‑Live – GPT‑Live‑1과 GPT‑Live‑1 mini – 를 순차적으로 제공하기 시작합니다.
- GPT‑Live‑1은 Go, Plus, Pro 사용자를 위한 ChatGPT Voice의 기본 모델이 됩니다.
- GPT‑Live‑1 mini는 무료 사용자를 위한 기본 모델이 됩니다.
- 롤아웃은 iOS, Android, 그리고 ChatGPT.com을 포함합니다.
- 개발자와 기업은 제공된 양식을 통해 API에서 모델을 사용할 수 있게 될 때 알림을 받을 수 있습니다.
- 음성 + 비디오 또는 화면 공유와 같은 기능이 필요한 경우 기존 ChatGPT Voice(표준 및 Advanced Voice Mode)는 계속 접근 가능합니다.
Limitations and Future Work
출시 시점에 GPT‑Live는 ChatGPT에서 비디오와 화면 공유가 포함된 음성을 지원하지 않지만, 곧 이러한 기능을 도입하기 위해 작업 중입니다.
- 일부 언어에서는 모델이 비원어민 억양을 보이거나 유창성에 차이가 있을 수 있으며, 개선 작업이 진행 중입니다.
- 궁극적인 목표는 진정으로 자연스러운 인간‑AI 상호작용을 구현하고, 시간이 지남에 따라 음성을 점점 더 복잡하고 장기적이며 에이전시가 필요한 작업에 확장하는 것입니다.
위 모든 진술은 원본에서 직접 인용한 것이며, 외부 사실이나 숫자는 추가되지 않았습니다.
Summary
OpenAI는 GPT‑Live‑1과 GPT‑Live‑1 mini를 발표했습니다. 전이중 음성 모델로 자연스럽고 중단 가능한 대화를 가능하게 하며 복잡한 추론은 GPT‑5.5에 위임하고, 전 세계 ChatGPT 사용자에게 순차적으로 제공됩니다.
Title
GPT‑Live‑1 및 GPT‑Live‑1 mini 소개: OpenAI의 새로운 전이중 음성 모델
Sources
- OriginalIntroducing GPT-Live