nu-dialogue/j-moshi
J-Moshi: A Japanese Full-duplex Spoken Dialogue System
何を解決するか
J-Moshi は日本語向けに設計されたフルデュプレックス音声対話システムです。人間同士の会話に似た自然でリアルタイムの音声インタラクションを実現するための課題に対処しており、リアルタイムでの重なり話や応答語(あいづち)の機能を可能にします。
動作方法
このシステムは Kyutai Labs の 7B パラメータの Moshi モデルに基づいています。大規模な日本語音声対話データを用いた追加学習により開発され、J-CHAT、日本語 Callhome、および内部のチャット・相談対話コーパスなどのコーパスが使用されています。さらに、Multi-stream TTS を用いて生成された合成データを組み込んだ専用バージョンである J-Moshi-ext も存在し、性能を向上させています。
対象ユーザー
日本語音声AI、音声対話システム、自然な人間-コンピュータインタラクション(HCI)に取り組む研究者や開発者。
特徴
- フルデュプレックス通信: 自然なターンチェンジを伴うリアルタイム双向音声インタラクションを可能にします。
- 日本語データのキュレーション: 多様な音声およびテキストベースの対話コーパスを用いて学習されています。
- 2種類のモデルバージョン: 標準版と合成データを用いた拡張版(J-Moshi-ext)の両方を提供します。
- HuggingFace統合: PyTorch 実装の Moshi を通じて、モデルの容易なデプロイが可能です。
関連
- プロジェクト
flyteorg/flytekitFlytekit Python は、`@task` および `@workflow` デコレータを使用して、純粋な Python で AI/ML ワークフローを記述・テスト・デプロイできる、Flyte の公式 SDK です。`pip install flytekit` でインストールし、クイックスタートガイドに従い、プラグインによる拡張またはドキュメントに従った貢献が可能です。
- プロジェクト
aa0101181514/tw-legal-ragtw-legal-rag は、2200万件以上の台湾判例、法令、行政処分を含むホストされた意味的検索サービスに接続するオープンソースPython CLIです。自然言語による検索、正確な事件番号の取得、結果(要約、判例履歴、引用許可リストを含む)をJSONファイルにバンドル化、LLM生成回答に対する決定論的な引用検証が可能。ツール自体はLLMを呼び出さず、APIキーも不要で、法律AIアプリケーション向けの検索拡張生成(RAG)フロントエンドとして機能します。
- プロジェクト
OpenVoiceOS/ovos-installerOpen Voice OS用の簡素化されたインストーラー。ユーザーがRaspberry Pi、Linux、またはMacハードウェア上でプライバシー重視のオープンソース音声アシスタントをデプロイできるようにします。
- プロジェクト
csyangwen/dsh-memory-evolvedsh‑memory‑evolve は、AIに永続的なクロスセッション記憶、ToDo/プロジェクトログ、Gitベースの記憶同期、マルチエージェントオーケストレーション(内部サブセッションと外部AIプロバイダー)、ファイル用の検索可能な無限キャンバス、オプションのレビューセッション、モバイル対応UIと通知を提供するDSHプラグインです。AIが長期的なパートナーとチームコーディネーターとして機能させつつ、すべての書き込みをユーザーが制御できるようにします。