facebookresearch/seamless_communication

Foundational Models for State-of-the-Art Speech and Text Translation

解決する課題

Seamlessは、異なる言語間のコミュニケーションをより自然で本物らしくするためのAIモデルファミリーです。話者の声のスタイル、韻律(発話速度やポーズなど)を維持しながら、100近い言語間で音声とテキストを翻訳するという課題に取り組んでいます。また、リアルタイムでの翻訳も可能です。

仕組み

このプロジェクトは、組み合わせて使用したり、個別に使用したりできるいくつかの特化型モデルで構成されています:

  • SeamlessM4T: 音声から音声、音声からテキスト、テキストから音声、テキストからテキストの翻訳、および自動音声認識(ASR)を処理する基盤となるマルチモーダル機械翻訳モデル。
  • SeamlessExpressive: 音声から音声の翻訳において、韻律と声のスタイルを維持することに特化したモデル。
  • SeamlessStreaming: 同時翻訳とストリーミングASRを可能にするモデル。
  • Seamless: ストリーミング機能と表現力を組み合わせた統合モデル。

これらのモデルは fairseq2 ライブラリによって駆動され、W2v-BERT 2.0 音声エンコーダーを利用しています。リソースの限られたプラットフォームへのデプロイには、unity.cpp を使用することで、GGML C tensor ライブラリを用いたモデルの実行が可能です。

対象者

多言語翻訳アプリケーション、リアルタイム通信ツール、および言語を越えた高忠実度な音声保存を必要とするシステムを構築している研究者や開発者。

ハイライト

  • 大規模な多言語対応: 複数のモダリティにわたって100近い言語をサポート。
  • オールインワン翻訳: 単一のフレームワークで S2ST、S2TT、T2ST、T2TT、および ASR を処理。
  • 韻律の保存: 発話速度やポーズを捉え、元の話者の本物の感覚を維持。
  • リアルタイム性能: 同時ストリーミング翻訳をサポート。
  • 効率的な推論: 様々なプラットフォームへの統合を容易にする unity.cpp 実装を含む。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト