Nari Qwen3-TTS 및 Qwen3-ASR 성능 벤치마크
2026년 9월 14일 기준 Nari Labs는 Coval 음성 AI 벤치마크에서 선도적인 위치를 차지하며, 텍스트-to-음성(TTS) 및 음성-to-텍스트(STT) 모델 모두에서 품질-지연 시간 파레토 경계에 위치했다. 회사는 벤치마크에서 공개된 모든 모델 중 지연 시간-비용 및 품질-비용 파레토 경계를 선도하고 있다고 보고했다.
음성-to-텍스트(ASR) 성능
Nari Qwen3-ASR Fast 모델은 Time-to-Final-Segment(TTFS)에서 p50 44ms, 단어 오류율(WER) 3.6%로 1위를 기록했다. 정확도 측면에서는 AssemblyAI의 Universal 3.5 Pro(3.5% WER)에 이어 2위를 차지했다.
비용 효율성
Qwen3-ASR Fast는 시간당 $0.12에 가격 책정되어 Coval 가격 목록에 공개된 모델 중 가격이 가장 낮은 두 번째 수준이다. 이는 경쟁사 대비 큰 비용 절감을 의미한다:
- Universal 3.5 Pro: 3.75배 더 비쌈
- Deepgram Nova 3: 2.4배 더 비쌈
- Nari Standard 엔드포인트: 시간당 $0.06
텍스트-to-음성(TTS) 성능
Nari Qwen3-TTS Fast 모델은 WER 3.8%로 1위를 기록했으며, Time-to-First-Audio(TTFA)에서 p50 63ms로 2위를 차지했다. 지연 시간이 더 낮은 유일한 모델은 Fluxions의 vui(49ms)이며, 이는 Nari가 제공하는 17억 파라미터 Qwen3-TTS 모델과 비교해 3억 파라미터 모델이다.
비용 효율성
100만 자당 $10의 가격으로, Qwen3-TTS Fast 엔드포인트는 Coval 가격 목록에서 가장 저렴한 모델 중 하나와 동률을 이뤘다. 이는 다음과 같은 비교와 같다:
- ElevenLabs Eleven v3 Conversational: 5배 더 비쌈
- Cartesia Sonic 3.6: 6.5배 더 비쌈
- Nari Standard 엔드포인트: 100만 자당 $5
인프라 비교
Nari Labs는 공식 Qwen3 TTS Flash Realtime 엔드포인트와 동일한 모델을 사용했음에도 불구하고 훨씬 더 우수한 성능을 기록했다. 공식 엔드포인트는 중앙 TTFA 692ms, WER 8.8%를 기록했다. Nari는 Baseten의 전용 Qwen3-TTS 엔드포인트(중앙 TTFA 101ms, WER 6.0%) 또한 능가했다.
커뮤니티 피드백 및 기술 논의
Hacker News에서의 커뮤니티 반응은 고성능 음성 AI의 기술적 잠재력과 실용적 도전 과제를 동시에 강조했다.
기술적 관찰
사용자들은 음성 일관성과 재생 속도 문제를 지적했으며, 한 사용자는 다음과 같이 언급했다:
모든 TTS 생성물이 너무 빠릅니다. 마치 1.25~1.5배 속도로 팟캐스트를 듣는 것처럼 느껴집니다.
또 다른 사용자는 33초 길이의 클립 중간에 음성 교체가 발생했다고 보고했다.
시장 및 평가 관점
업계 관계자들은 독립적인 검증과 다양한 모델 옵션의 중요성을 강조했다.
- 독립 평가: 사용자들은 Datapoint AI와 같은 제3자 기관의 검증이 품질 주장의 신뢰성을 확보하기 위해 필요하다고 제안했다.
- 시장 역학: AssemblyAI의 개발자 관계 담당자는 음성 모델은 LLM API와 달리 '승자독식 시장'이 아니라고 지적했다.
- 미래 방향성: 일부 사용자는 다음 주요 발전 방향으로 GPT-Live-1과 같은 통합 실시간 음성 경험의 저렴한 오픈소스 대안 창출을 제안했다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch