facebookresearch/seamless_communication

Foundational Models for State-of-the-Art Speech and Text Translation

解決的問題

Seamless 是一個旨在使不同語言之間的溝通更加自然與真實的 AI 模型系列。它解決了在近 100 種語言中進行語音與文本翻譯的挑戰,同時保持原始說話者的聲音風格、韻律(如語速與停頓)以及執行即時翻譯的能力。

工作原理

該專案由幾個可以組合使用或獨立使用的專業模型組成:

  • SeamlessM4T:一個基礎的多模態機器翻譯模型,可處理語音到語音、語音到文本、文本到語音、文本到文本翻譯以及自動語音識別 (ASR)。
  • SeamlessExpressive:一個專注於在語音到語音翻譯過程中保留韻律與聲音風格的模型。
  • SeamlessStreaming:一個實現同步翻譯與串流 ASR 的模型。
  • Seamless:一個結合了串流功能與表現力的統一模型。

這些模型由 fairseq2 函式庫驅動,並使用 W2v-BERT 2.0 語音編碼器。為了在資源受限的平台上進行部署,unity.cpp 允許模型使用 GGML C tensor 函式庫運行。

適用對象

構建多語言翻譯應用、即時通訊工具以及需要跨語言實現高保真語音保存的系統的研究人員與開發人員。

亮點

  • 大規模多語言支援:支援多種模態下的近 100 種語言。
  • 全能翻譯:在單一框架中處理 S2ST、S2TT、T2ST、T2TT 與 ASR。
  • 韻律保留:捕捉語速與停頓,以保持原始說話者的真實感。
  • 即時能力:支援同步串流翻譯。
  • 高效推理:包含用於在各種平台上更輕鬆整合的 unity.cpp 實作。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案