facebookresearch/seamless_communication

Foundational Models for State-of-the-Art Speech and Text Translation

해결하는 문제

Seamless는 서로 다른 언어 간의 커뮤니케이션을 더욱 자연스럽고 실제처럼 만들기 위해 설계된 AI 모델 제품군입니다. 이 모델은 원래 화자의 목소리 스타일, 운율(말하기 속도 및 일시 정지 등)을 유지하면서 100개에 가까운 언어에 대해 음성과 텍스트를 번역하는 과제를 해결하며, 실시간 번역 기능을 제공합니다.

작동 방식

이 프로젝트는 결합하여 사용하거나 독립적으로 사용할 수 있는 여러 전문 모델로 구성됩니다:

  • SeamlessM4T: 음성-대-음성, 음성-대-텍스트, 텍스트-대-음성, 텍스트-대-텍스트 번역 및 자동 음성 인식(ASR)을 처리하는 기반 멀티모달 기계 번역 모델.
  • SeamlessExpressive: 음성-대-음성 번역 중에 운율과 목소리 스타일을 보존하는 데 중점을 둔 모델.
  • SeamlessStreaming: 동시 번역 및 스트리밍 ASR을 가능하게 하는 모델.
  • Seamless: 스트리밍 기능과 표현력을 결합한 통합 모델.

이 모델들은 fairseq2 라이브러리를 기반으로 하며 W2v-BERT 2.0 음성 인코더를 사용합니다. 리소스가 제한된 플랫폼에 배포하기 위해 unity.cpp를 사용하면 GGML C tensor 라이브러리를 사용하여 모델을 실행할 수 있습니다.

대상 사용자

다국어 번역 애플리케이션, 실시간 통신 도구 및 언어 간 고충실도 음성 보존이 필요한 시스템을 구축하는 연구자 및 개발자.

주요 특징

  • 방대한 다국어 지원: 다양한 모달리티에 걸쳐 100개에 가까운 언어를 지원합니다.
  • 올인원 번역: 단일 프레임워크에서 S2ST, S2TT, T2ST, T2TT 및 ASR을 처리합니다.
  • 운율 보존: 말하기 속도와 일시 정지를 포착하여 원래 화자의 실제 느낌을 유지합니다.
  • 실시간 기능: 동시 스트리밍 번역을 지원합니다.
  • 효율적인 추론: 다양한 플랫폼에 쉬운 통합을 위한 unity.cpp 구현을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트