facebookresearch/seamless_communication

Foundational Models for State-of-the-Art Speech and Text Translation

解决的问题

Seamless 是一个旨在使不同语言之间的沟通更加自然和真实的 AI 模型系列。它解决了在近 100 种语言中进行语音和文本翻译的挑战,同时保持原始说话者的声音风格、韵律(如语速和停顿)以及执行实时翻译的能力。

工作原理

该项目由几个可以组合使用或独立使用的专业模型组成:

  • SeamlessM4T: 一个基础的多模态机器翻译模型,可处理语音到语音、语音到文本、文本到语音、文本到文本翻译以及自动语音识别 (ASR)。
  • SeamlessExpressive: 一个专注于在语音到语音翻译过程中保留韵律和声音风格的模型。
  • SeamlessStreaming: 一个实现同步翻译和流式 ASR 的模型。
  • Seamless: 一个结合了流式传输和表现力能力的统一模型。

这些模型由 fairseq2 库驱动,并使用 W2v-BERT 2.0 语音编码器。为了在资源受限的平台上进行部署,unity.cpp 允许模型使用 GGML C tensor 库运行。

适用对象

构建多语言翻译应用、实时通信工具以及需要跨语言实现高保真语音保存的系统的研究人员和开发人员。

亮点

  • 大规模多语言支持:支持多种模态下的近 100 种语言。
  • 全能翻译:在单个框架中处理 S2ST、S2TT、T2ST、T2TT 和 ASR。
  • 韵律保留:捕捉语速和停顿,以保持原始说话者的真实感。
  • 实时能力:支持同步流式翻译。
  • 高效推理:包含用于在各种平台上更轻松集成的 unity.cpp 实现。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目