jd-opensource/JoyAI-VL-Interaction

JoyAI-VL-Interaction: An Open Real-time Video-Language Interaction System

解決的問題

大多數AI模型都是回合制的,表示只有在收到使用者提示後才會回應。JoyAI-VL-Interaction透過建立一個「在場」的視覺-語言模型來解決此問題——它持續監看視訊串流,並主動決定何時發言、保持沉默,或將複雜任務委派給其他代理,從而實現無需使用者觸發的即時、事件驅動式互動。

工作原理

該系統以8B規模的視覺優先模型(JoyAI-VL-8B)為核心,每秒根據視覺輸入做出決策。它使用一種稱為AdaCodec的預測性視訊編碼器,透過在可預測的畫格上減少token消耗、在場景變更時增加token消耗來管理token預算。該模型在超過四百萬個時間對齊的互動樣本上進行訓練,並透過強化學習進行優化。完整的部署架構包含五個可插拔服務:推論、用於串流的WebUI、ASR(語音辨識)、TTS(語音合成),以及用於任務委派的背景代理。

適用對象

本專案適用於開發即時AI助理、監控系統,或需要主動視覺感知與亞秒級回應時間的互動式視訊應用的開發者與研究人員。

核心亮點

  • 即時在場:能在不到一秒內回應視覺事件。
  • 視覺觸發的主動性:可根據所見內容主動啟動對話,而無需等待使用者提示。
  • 代理委派:可在持續監控串流的同時,將複雜子任務交由背景模型或API處理。
  • 開源架構:提供模型權重、訓練配方、時間對齊的互動資料,以及完整的可部署系統。
  • 統一能力:單一模型即可同時處理即時串流互動與離線視訊理解。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch