Gemini 3.5 Transcribe 릴리스 노트
Gemini 3.5 Transcribe는 지능적이고 실시간 음성-텍스트 변환을 제공합니다
Google은 원시 오디오를 정교하고 형식화된 텍스트로 변환할 수 있도록 설계된 음성-텍스트(STT) 모델인 Gemini 3.5 Transcribe를 출시했습니다. 이 모델은 전통적인 음성 인식과 달리, 불필요한 말을 제거("ums"과 "ahs"), 자기 수정을 처리(예: "화요일에 만나자—아니, 수요일에")하고, 사용자의 의도를 반영하도록 출력을 자동으로 형식화합니다.
API 접근성 및 구현 방법
Gemini 3.5 Transcribe는 개발자의 다양한 아키텍처 요구를 지원하기 위해 두 가지 별도의 API를 통해 제공됩니다:
- 실시간 스트리밍(
gemini-3.5-transcribe-live): Live API를 통해 접근 가능하며, 상호작용형 음성 애플리케이션에 서브초 단위 지연을 제공하는 양방향 스트리밍을 지원합니다. - 사전 녹음된 오디오 처리(
gemini-3.5-transcribe): Interactions API를 통해 접근 가능하며, 녹음된 오디오, 회의 기록, 통화 기록을 처리하고, 최대 3명의 화자에 대해 화자 식별을 제공하며 단어 수준의 타임스탬프를 지원합니다.
개발자는 Google AI Studio와 Gemini Enterprise Agent Platform의 Gemini API를 통해 이 모델에 접근할 수 있습니다.
기술 성능 및 벤치마크
Gemini 3.5 Transcribe는 이전 모델인 Chirp 3에 비해 지연 시간과 정확도 측면에서 크게 향상되었습니다:
- 단어 오류율(WER): Artificial Analysis에 따르면, 스트리밍 사용 사례에서는 평균 WER가 4.0%이며, 비스트리밍 사용 사례에서는 2.6%입니다. FLEURS 벤치마크에서는 스트리밍 모드에서 5.50%, 비스트리밍 모드에서 5.04%의 WER를 기록했습니다.
- 지연 시간: 최종 전사 시간이 Chirp 3에 비해 70% 개선되었습니다.
- 언어 지원: 모델은 85개 이상의 언어를 자동으로 감지하고 전사하며, 지역 방언과 다양한 방언을 포함합니다.
- 사용자 정의: 전문 용어와 고유한 철자를 인식할 수 있도록 사용자 정의 어휘를 지원합니다.
Google 생태계 내 통합
Google은 이 모델을 여러 소비자 및 개발자 인터페이스에 통합하고 있습니다:
- Gboard(안드로이드): "Rambler" 기능은 3.5 Transcribe를 사용해 말하는 생각을 형식화된 텍스트로 변환하고, 음성 기반 편집 및 스타일 변경을 가능하게 합니다.
- Gemini 앱(macOS): 자연스러운 음성 전사 및 음성 명령을 지원하며, 화면 컨텍스트와 결합하여 로컬 파일 요약이나 이미지 생성을 가능하게 합니다.
- Google Antigravity: 화면 컨텍스트와 채팅 기록을 결합하여 파일 이름과 활성 문서에 대한 전사 정확도를 향상시킵니다.
- Chrome: 곧 출시될 기능으로, 웹의 어떤 입력 필드에서도 "말로 입력"할 수 있게 됩니다.
커뮤니티 피드백 및 기술적 비판
공식 릴리스는 성능 향상을 강조하지만, Hacker News에서의 개발자 및 사용자 논의에서는 몇 가지 논란과 기술적 격차가 드러났습니다:
정확도 vs. "스마트" 편집
일부 사용자는 "스마트 전사" 기능이 말의 어색함을 제거하는 방식으로 의미 있는 맥락을 실수로 제거할 수 있다고 지적했습니다. 한 사용자는 "나는 그것을 확인하는 데 망설였다"는 표현이 제거되어 문장의 의도가 왜곡되었다고 언급했습니다.
화자 구분 및 지연 시간
비판자들은 화자 구분이 최대 3명까지 제한되며(3명 이상은 실험적), Soniox나 Deepgram과 같은 경쟁 제품에 비해 뒤처진다고 지적했습니다. 또한 일부 개발자는 정확도는 높지만, 고성능 실시간 번역 앱에 적합한 지연 시간 개선이 여전히 필요하다고 주장했습니다.
신뢰성 및 환상 생성
사용자들은 Chirp에서 유래한 환상 생성 문제를 이 모델이 물려받았는지에 대해 우려를 표했습니다. 한 개발자는 Chirp가 노이즈나 침묵을 마주할 때 반복적인 텍스트(예: "모르겠어요. 모르겠어요.")를 생성하는 경우가 있어, 타임스탬프는 Whisper를, 수정은 Gemini Flash를 사용하는 하이브리드 접근 방식을 채택했다고 밝혔습니다.
가격 및 접근성
커뮤니티 구성원들은 발표에서 가격에 대한 투명성이 부족하다고 지적했습니다. API 문서 기준으로 비용은 다음과 같습니다:
| 모델 | 입력 비용 | 출력 비용 |
|---|---|---|
| 3.5 Transcribe Live | $3.50 / 1M 토큰 (또는 $0.005/분 오디오) | $21.00 / 1M 토큰 (또는 $0.004/분 텍스트) |
| 3.5 Transcribe | $2.00 / 1M 토큰 (또는 $0.003/분 오디오) | $12.00 / 1M 토큰 (또는 $0.002/분 텍스트) |
도구 및 워크플로우
일부 개발자는 Google Cloud 청구 계정 처리 시간이 느려서 번거로움을 겪었다고 보고했으며, OpenRouter와 같은 경쟁사보다 설정 시간이 훨씬 길다고 지적했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch