jd-opensource/JoyAI-VL-Interaction
JoyAI-VL-Interaction: An Open Real-time Video-Language Interaction System
何を解決するか
ほとんどのAIモデルはターンベースであり、ユーザーのプロンプトを待ってから応答します。JoyAI-VL-Interactionは、視覚言語モデルが「場面に存在する」ようにすることでこの問題を解決します。モデルはビデオストリームを継続的に監視し、いつ話すか、沈黙するか、または複雑なタスクを別のエージェントに委任するかを積極的に判断します。これにより、ユーザーのトリガーなしにリアルタイムでイベント駆動のインタラクションが可能になります。
動作方法
このシステムは、8B規模の視覚優先モデル(JoyAI-VL-8B)を基盤としています。このモデルは1秒ごとに視覚入力に基づいて判断を行います。予測可能なフレームには少ないトークンを、シーン変化には多いトークンを割り当てる予測型ビデオコーデック「AdaCodec」を使用してトークン予算を管理します。モデルは400万以上の時系列同期インタラクションサンプルで訓練され、強化学習によって最適化されています。完全なデプロイスタックには、5つのプラグ可能なサービスが含まれます:推論、ストリーミング用WebUI、ASR(音声認識)、TTS(音声合成)、およびタスク委任用のバックグラウンドエージェント。
対象ユーザー
リアルタイムAIアシスタント、監視システム、またはプロアクティブな視覚認識と1秒未満の応答時間を必要とするインタラクティブなビデオアプリケーションを開発している開発者や研究者向けです。
主な特徴
- リアルタイムの存在感:視覚イベントに1秒未満で応答可能。
- 視覚トリガーによるプロアクティブ性:プロンプトを待たずに、見ている内容に基づいて会話を開始可能。
- エージェントの委任:困難なサブタスクをバックグラウンドモデルやAPIに委任しつつ、ストリームの監視を継続可能。
- オープンスタック:モデル重み、トレーニングレシピ、時系列同期インタラクションデータ、完全にデプロイ可能なシステムを提供。
- 統合された能力:リアルタイムストリーミングインタラクションとオフライン動画理解の両方を1つのモデルで処理可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch